配套 2 · 查字典
术语中英对照速查表
90 多个高频术语,按 数学 / 模型 / 训练 / 应用 / 工程 五类分列。每条一句话"人话解释",并尽量标注了它在正文中的首次出现位置。遇到看不懂的词,回来查这一页——比翻全书快。
① 数学基础(约 15 条)
| 术语(中 / 英) | 一句话解释 | 首次出现 |
|---|---|---|
| ★ 标量 / Scalar | 一个单独的数(如 5、0.3),没有方向。 | 附录 A |
| ★ 向量 / Vector | 一列数,可看作"带大小和方向的箭头";AI 里常代表一个词、一个样本。 | 附录 A |
| ★ 矩阵 / Matrix | 排成矩形的一堆数;批量处理向量的"表格运算器"。 | 附录 A |
| ★ 点积 / Dot product | 两个向量逐位相乘再求和;结果越大说明两个向量越"方向一致"(越相似)。 | 附录 A |
| ★ 概率 / Probability | 一件事发生的可能性,0–1 之间。AI 输出本质是给每个选项打分归一化后的概率。 | 附录 A |
| ★ 导数 / Derivative | 函数在某点的"斜率",表示往哪个方向变、变多快;训练时靠它找下降方向。 | 附录 A |
| 梯度 / Gradient | 导数推广到多变量:一个"指向上升最快方向"的向量;下降法沿它的反方向走。 | 第 2 章 |
| 参数 / Parameter | 模型里待学习的旋钮(权重 + 偏置)。"700 亿参数"就是 700 亿个旋钮。 | 第 1 章 |
| 维度 / Dimension | 向量里数的个数。词的"坐标"是几维的,就代表用几个数字描述它。 | 第 4 章 |
| 范数 / Norm | 向量"长度"的度量(如欧氏距离)。归一化常用它。 | 附录 B |
| Softmax | 把一堆分数变成"加起来等于 1 的概率分布",同时放大差距。 | 第 4 章 |
| Logits | 模型输出的"原始分数"(还没变成概率)。softmax 的输入。 | 第 4 章 |
| 交叉熵 / Cross-entropy | 衡量"预测分布"和"真实答案分布"差多远;分类/生成的默认损失函数。 | 第 2 章 |
| 特征 / Feature | 用来描述样本的每个属性(如电压、温度、违章类型)。"特征工程"= 挑选和加工属性。 | 第 7 章 |
| 归一化 / Normalization | 把数据压到统一尺度(如 0–1),防止大数欺负小数。 | 第 4 章 |
② 模型与架构(约 30 条)
| 术语(中 / 英) | 一句话解释 | 首次出现 |
|---|---|---|
| ★ 神经网络 / Neural Network | 由很多"带旋钮的小函数"(神经元)分层连接成的函数,能拟合超复杂规律。 | 第 1 章 |
| ★ 深度学习 / Deep Learning | 层数很多的神经网络学习("深"= 层多)。 | 第 1 章 |
| ★ 大语言模型 / LLM | 以 Transformer 为骨架、在海量文本上训练的巨型模型,会"接话"。 | 第 4 章 |
| ★ Transformer | 2017 年提出的架构:靠"自注意力"看全句,而不是逐词接力。 | 第 4 章 |
| ★ 自注意力 / Self-Attention | 让句子每个词按相关性"看"其他所有词并加权融合。 | 第 4 章 |
| ★ 多头注意力 / Multi-Head Attention | 多组 Q/K/V 并行算注意力,相当于多个专家从不同角度开会。 | 第 4 章 |
| ★ 词嵌入 / Embedding | 把词映射成向量坐标;意思相近的词坐标靠近。 | 第 4 章 |
| 位置编码 / Positional Encoding | 给每个词的位置贴一个"座位号"(sin/cos),让模型知道先后顺序。 | 第 4 章 |
| Q / K / V(查询 / 键 / 值) | 查字典三件套:Q 是"我想找什么",K 是"我有什么标签",V 是"我存的内容"。 | 第 4 章 |
| 前馈网络 / FFN | 注意力之后的"逐词思考层",每个词独立过一遍两层全连接。 | 第 4 章 |
| 残差连接 / Residual Connection | "抄近路"把输入直接加到输出后面,让深层网络好训练。 | 第 4 章 |
| 层归一化 / LayerNorm | 对一层内每个样本自己做归一化,稳定训练。 | 第 4 章 |
| 编码器 / Encoder | Transformer 中负责"读入并理解"输入的部分(BERT 只用它)。 | 第 4 章 |
| 解码器 / Decoder | 负责"逐词生成"输出的部分(GPT 只用它,还带掩码防止偷看答案)。 | 第 4 章 |
| 掩码 / Mask | 把某些位置"盖上":训练时盖住未来词,让模型只能看过去。 | 第 4 章 |
| Token / 词元 | 模型处理的最小文字单位(不一定是词,"我爱你"可能拆成 3 个)。 | 第 4 章 |
| 上下文窗口 / Context Window | 模型一次能"看"的 token 数量上限(如 128K)。 | 第 5 章 |
| 温度 / Temperature | 控制生成随机性的旋钮:低=保守稳定,高=发散敢编。 | 第 9 章 |
| 涌现能力 / Emergence | 模型大到一定程度突然出现的"小模型没有的能力"。 | 第 5 章 |
| 规模法则 / Scaling Law | "数据×参数×算力"和模型能力之间的经验规律:越大通常越强。 | 第 5 章 |
| 幻觉 / Hallucination | 模型一本正经地编造不存在的"事实"。 | 第 5 章 |
| 状态空间模型 / SSM | 替代注意力的路线之一,用"状态"压缩历史(Mamba 是其代表)。 | 第 6 章 |
| Mamba | 2023 年的 SSM 架构,想用线性复杂度替代注意力的平方复杂度。 | 第 6 章 |
| RWKV | 把 Transformer 和 RNN 优点结合的混合架构,推理省内存。 | 第 6 章 |
| 混合专家 / MoE | 把大模型拆成多个"专家"子网络,每次只激活一部分,省算力。 | 第 6 章 |
| RNN / 循环神经网络 | 老式序列模型:一个"记忆盒"接力传话,长句会忘事。 | 第 3 章 |
| LSTM | RNN 的改进版,给记忆盒加了"读写闸门",能记住更久。 | 第 3 章 |
| CNN / 卷积神经网络 | 用"滑动窗口"扫描的模型,擅长图像和局部特征。 | 第 7 章 |
| 扩散模型 / Diffusion Model | 图像生成主力:从"纯噪声"一步步去噪还原出图。 | 第 7 章 |
| 强化学习 / RL | 智能体靠"试错 + 奖励"学策略,像训宠物。 | 第 1 章 |
③ 训练与学习(约 20 条)
| 术语(中 / 英) | 一句话解释 | 首次出现 |
|---|---|---|
| ★ 监督学习 / Supervised Learning | 带标准答案的练习题:输入+答案,学输入→答案的映射。 | 第 1 章 |
| ★ 无监督学习 / Unsupervised Learning | 没有答案,自己找结构(如把相似的聚成一堆)。 | 第 1 章 |
| ★ 损失函数 / Loss Function | "错得有多离谱"的计分器,训练就是让它变小。 | 第 2 章 |
| ★ 梯度下降 / Gradient Descent | 蒙眼下山:每步朝"下降最快"的方向挪一点,反复直到谷底。 | 第 2 章 |
| ★ 反向传播 / Backpropagation | 责任分摊:把"总错误"按层反推回去,算出每个旋钮该往哪转。 | 第 2 章 |
| ★ 学习率 / Learning Rate | 每次下山迈多大步子:太大乱跳,太小太慢。 | 第 2 章 |
| ★ 过拟合 / Overfitting | 把练习题答案背下来了,换新题就废(死记硬背型选手)。 | 第 2 章 |
| 欠拟合 / Underfitting | 还没学会就停了,训练集上都很差(没认真学型选手)。 | 第 2 章 |
| 训练集 / 验证集 / 测试集 | 练习题 / 模拟考 / 期末考:分别用来学、调参、最终打分。 | 第 2 章 |
| 批次 / Batch | 一次喂给模型的样本组。"批量训练"= 攒一批再更新。 | 第 2 章 |
| 轮次 / Epoch | 把整个数据集从头到尾学一遍 = 1 个 epoch。 | 第 2 章 |
| 预训练 / Pre-training | 在海量通用数据上先学一遍(打基础),大模型的第一步。 | 第 4 章 |
| 微调 / Fine-tuning | 在预训练基础上用专门数据小步接着学(定向培养)。 | 第 5 章 |
| 指令微调 / Instruction Tuning | 用"问题-回答"对微调,让模型学会听指令(从接话变成回答问题)。 | 第 5 章 |
| RLHF | 用人类反馈打分再强化学习,让模型说话更讨人喜欢(对齐人的偏好)。 | 第 5 章 |
| 强化学习 / RL(训练侧) | 靠"奖励信号"而非标准答案来学。 | 第 1 章 |
| 激活函数 / Activation Function | 给神经元加"非线性"的小函数(如 ReLU),没有它多层≈一层。 | 第 1 章 |
| 正则化 / Regularization | 防止死记硬背的"罚则"(如惩罚大参数),提高泛化。 | 第 2 章 |
| Dropout | 训练时随机"掐掉"一部分神经元,强迫模型学得更稳健。 | 第 2 章 |
| 推理 / Inference | 训练完之后"用模型"算一次输出(大模型回答你的问题就是推理)。 | 第 4 章 |
④ 大模型应用(约 15 条)
| 术语(中 / 英) | 一句话解释 | 首次出现 |
|---|---|---|
| ★ 提示词 / Prompt | 你写给大模型的话;"提示工程"= 研究怎么写效果最好。 | 第 8 章 |
| ★ 提示工程 / Prompt Engineering | 通过设计提示词引导模型输出(给出角色、约束、示例等)。 | 第 8 章 |
| ★ RAG / 检索增强生成 | 开卷考试:先查外部知识库,把相关内容塞进提示词再让模型回答。 | 第 8 章 |
| ★ 智能体 / Agent | 能自己"想、调工具、做动作、看结果"的自动助理,而不是一问一答。 | 第 8 章 |
| 工具调用 / Tool Calling | 模型不只会说话,还能调用函数/API(查天气、算数、查库)。 | 第 8 章 |
| 函数调用 / Function Calling | Tool Calling 的早期叫法,模型输出"该调用哪个函数、传什么参"。 | 第 8 章 |
| 向量数据库 / Vector DB | 专门存"向量"并支持相似度检索的库,RAG 的查字典工具。 | 第 8 章 |
| 嵌入模型 / Embedding Model | 把文本/数据变成向量的模型,RAG 里负责"把资料变成可检索的向量"。 | 第 8 章 |
| 上下文注入 / Context Injection | 把外部资料拼进提示词给模型"看",RAG 的核心动作。 | 第 8 章 |
| 护栏 / Guardrails | 给 AI 系统设的"安全围栏":权限、审查、禁止项、人工确认。 | 第 8 章 |
| 评估 / Evaluation | 给 AI 系统定期打分(准确率、覆盖率、用户满意度),防止"摆烂"。 | 第 8 章 |
| 幻觉抑制 / Hallucination Mitigation | 用 RAG、给来源、限范围等手段减少编造。 | 第 8 章 |
| 系统提示词 / System Prompt | 藏在后台的"角色设定":规定模型的身份和行为规则。 | 第 8 章 |
| 少样本提示 / Few-shot | 在提示词里给几个示例(示范),模型照葫芦画瓢。 | 第 8 章 |
| 思维链 / Chain-of-Thought | 让模型"先想后答",把推理步骤写出来,复杂题正确率大增。 | 第 8 章 |
⑤ 工程与评估(约 12 条)
| 术语(中 / 英) | 一句话解释 | 首次出现 |
|---|---|---|
| ★ Harness / 应用工程 | 把模型包起来的整套"外围工程":提示、检索、工具、评估、护栏。第 8 章主题。 | 第 8 章 |
| API | 程序之间调用的接口;"调大模型 API"= 让程序直接请求模型服务。 | 第 9 章 |
| SDK | 厂商提供的开发工具包,让调用 API 更省事。 | 第 9 章 |
| Latency / 延迟 | 从发请求到收到回答的时间,工程上要优化它。 | 第 8 章 |
| 吞吐量 / Throughput | 单位时间能处理多少请求,监控系统关心这个。 | 第 8 章 |
| 工作流 / Workflow | 把"人做的流程"固化成步骤化程序(如每日自动报表)。 | 第 8 章 |
| 自动化 / Automation | 让系统定时/触发式替人干活,减少重复劳动。 | 第 8 章 |
| 数据脱敏 / Data Anonymization | 去掉或替换敏感信息(姓名→编号),合规前提。 | 第 9 章 |
| 版本控制 / Version Control | 给代码/提示词/数据存"历史版本",能回滚,工程基本功。 | 第 9 章 |
| 监控 / Monitoring | 上线后持续观察系统表现(准确率下降?变慢了?)——你本行。 | 第 8 章 |
| 回归测试 / Regression Test | 改动后跑旧用例,确保"没改坏原来的功能"。 | 第 8 章 |
| 可解释性 / Explainability | 能说清楚"模型为什么这么判断"。大模型在这点上很弱。 | 第 5 章 |
⑥ 其他模型家族(约 10 条)
| 术语(中 / 英) | 一句话解释 | 首次出现 |
|---|---|---|
| ★ 线性回归 / Linear Regression | 找一条直线(或平面)拟合数据:x 变 → y 按比例变。 | 第 7 章 |
| 逻辑回归 / Logistic Regression | 回归版"分类器":输出概率,判断是/否(如是否违章)。 | 第 7 章 |
| ★ 决策树 / Decision Tree | 一连串"是/否"判断组成的分叉树,像倒闸操作判断流程。 | 第 7 章 |
| 随机森林 / Random Forest | 很多棵决策树投票,稳、不容易过拟合。 | 第 7 章 |
| SVM / 支持向量机 | 找一条"分得最开"的边界线把两类分开。 | 第 7 章 |
| K-means | 无监督聚类:把数据自动分成 K 堆,每堆找质心。 | 第 7 章 |
| KNN / K 近邻 | 看离我最近的 K 个邻居怎么分类,我就怎么分(人以群分)。 | 第 7 章 |
| 主成分分析 / PCA | 降维:把高维数据压到低维但尽量保留差异(省存储、可视化)。 | 第 7 章 |
| ARIMA / 时序模型 | 经典时间序列预测:看"自己过去"的规律外推。 | 第 7 章 |
| 编码器-解码器 / Seq2Seq | "翻译机"结构:先读完全句,再生成另一句(Transformer 的前身理念)。 | 第 3 章 |
使用建议:不用背,查就完了
术语表是字典不是课本——不要试图背下来。正确用法:读正文遇到陌生词 → 来这里查一句话解释 → 回到正文看它在上下文里的样子。查过两三次的词自然就记住了。真正要背的只有标 ★ 的约 20 个,它们构成了你与人交流 AI 的"最小词汇量"。