配套 2 · 查字典

术语中英对照速查表

90 多个高频术语,按 数学 / 模型 / 训练 / 应用 / 工程 五类分列。每条一句话"人话解释",并尽量标注了它在正文中的首次出现位置。遇到看不懂的词,回来查这一页——比翻全书快。

① 数学基础(约 15 条)

术语(中 / 英)一句话解释首次出现
★ 标量 / Scalar一个单独的数(如 5、0.3),没有方向。附录 A
★ 向量 / Vector一列数,可看作"带大小和方向的箭头";AI 里常代表一个词、一个样本。附录 A
★ 矩阵 / Matrix排成矩形的一堆数;批量处理向量的"表格运算器"。附录 A
★ 点积 / Dot product两个向量逐位相乘再求和;结果越大说明两个向量越"方向一致"(越相似)。附录 A
★ 概率 / Probability一件事发生的可能性,0–1 之间。AI 输出本质是给每个选项打分归一化后的概率。附录 A
★ 导数 / Derivative函数在某点的"斜率",表示往哪个方向变、变多快;训练时靠它找下降方向。附录 A
梯度 / Gradient导数推广到多变量:一个"指向上升最快方向"的向量;下降法沿它的反方向走。第 2 章
参数 / Parameter模型里待学习的旋钮(权重 + 偏置)。"700 亿参数"就是 700 亿个旋钮。第 1 章
维度 / Dimension向量里数的个数。词的"坐标"是几维的,就代表用几个数字描述它。第 4 章
范数 / Norm向量"长度"的度量(如欧氏距离)。归一化常用它。附录 B
Softmax把一堆分数变成"加起来等于 1 的概率分布",同时放大差距。第 4 章
Logits模型输出的"原始分数"(还没变成概率)。softmax 的输入。第 4 章
交叉熵 / Cross-entropy衡量"预测分布"和"真实答案分布"差多远;分类/生成的默认损失函数。第 2 章
特征 / Feature用来描述样本的每个属性(如电压、温度、违章类型)。"特征工程"= 挑选和加工属性。第 7 章
归一化 / Normalization把数据压到统一尺度(如 0–1),防止大数欺负小数。第 4 章

② 模型与架构(约 30 条)

术语(中 / 英)一句话解释首次出现
★ 神经网络 / Neural Network由很多"带旋钮的小函数"(神经元)分层连接成的函数,能拟合超复杂规律。第 1 章
★ 深度学习 / Deep Learning层数很多的神经网络学习("深"= 层多)。第 1 章
★ 大语言模型 / LLM以 Transformer 为骨架、在海量文本上训练的巨型模型,会"接话"。第 4 章
★ Transformer2017 年提出的架构:靠"自注意力"看全句,而不是逐词接力。第 4 章
★ 自注意力 / Self-Attention让句子每个词按相关性"看"其他所有词并加权融合。第 4 章
★ 多头注意力 / Multi-Head Attention多组 Q/K/V 并行算注意力,相当于多个专家从不同角度开会。第 4 章
★ 词嵌入 / Embedding把词映射成向量坐标;意思相近的词坐标靠近。第 4 章
位置编码 / Positional Encoding给每个词的位置贴一个"座位号"(sin/cos),让模型知道先后顺序。第 4 章
Q / K / V(查询 / 键 / 值)查字典三件套:Q 是"我想找什么",K 是"我有什么标签",V 是"我存的内容"。第 4 章
前馈网络 / FFN注意力之后的"逐词思考层",每个词独立过一遍两层全连接。第 4 章
残差连接 / Residual Connection"抄近路"把输入直接加到输出后面,让深层网络好训练。第 4 章
层归一化 / LayerNorm对一层内每个样本自己做归一化,稳定训练。第 4 章
编码器 / EncoderTransformer 中负责"读入并理解"输入的部分(BERT 只用它)。第 4 章
解码器 / Decoder负责"逐词生成"输出的部分(GPT 只用它,还带掩码防止偷看答案)。第 4 章
掩码 / Mask把某些位置"盖上":训练时盖住未来词,让模型只能看过去。第 4 章
Token / 词元模型处理的最小文字单位(不一定是词,"我爱你"可能拆成 3 个)。第 4 章
上下文窗口 / Context Window模型一次能"看"的 token 数量上限(如 128K)。第 5 章
温度 / Temperature控制生成随机性的旋钮:低=保守稳定,高=发散敢编。第 9 章
涌现能力 / Emergence模型大到一定程度突然出现的"小模型没有的能力"。第 5 章
规模法则 / Scaling Law"数据×参数×算力"和模型能力之间的经验规律:越大通常越强。第 5 章
幻觉 / Hallucination模型一本正经地编造不存在的"事实"。第 5 章
状态空间模型 / SSM替代注意力的路线之一,用"状态"压缩历史(Mamba 是其代表)。第 6 章
Mamba2023 年的 SSM 架构,想用线性复杂度替代注意力的平方复杂度。第 6 章
RWKV把 Transformer 和 RNN 优点结合的混合架构,推理省内存。第 6 章
混合专家 / MoE把大模型拆成多个"专家"子网络,每次只激活一部分,省算力。第 6 章
RNN / 循环神经网络老式序列模型:一个"记忆盒"接力传话,长句会忘事。第 3 章
LSTMRNN 的改进版,给记忆盒加了"读写闸门",能记住更久。第 3 章
CNN / 卷积神经网络用"滑动窗口"扫描的模型,擅长图像和局部特征。第 7 章
扩散模型 / Diffusion Model图像生成主力:从"纯噪声"一步步去噪还原出图。第 7 章
强化学习 / RL智能体靠"试错 + 奖励"学策略,像训宠物。第 1 章

③ 训练与学习(约 20 条)

术语(中 / 英)一句话解释首次出现
★ 监督学习 / Supervised Learning带标准答案的练习题:输入+答案,学输入→答案的映射。第 1 章
★ 无监督学习 / Unsupervised Learning没有答案,自己找结构(如把相似的聚成一堆)。第 1 章
★ 损失函数 / Loss Function"错得有多离谱"的计分器,训练就是让它变小。第 2 章
★ 梯度下降 / Gradient Descent蒙眼下山:每步朝"下降最快"的方向挪一点,反复直到谷底。第 2 章
★ 反向传播 / Backpropagation责任分摊:把"总错误"按层反推回去,算出每个旋钮该往哪转。第 2 章
★ 学习率 / Learning Rate每次下山迈多大步子:太大乱跳,太小太慢。第 2 章
★ 过拟合 / Overfitting把练习题答案背下来了,换新题就废(死记硬背型选手)。第 2 章
欠拟合 / Underfitting还没学会就停了,训练集上都很差(没认真学型选手)。第 2 章
训练集 / 验证集 / 测试集练习题 / 模拟考 / 期末考:分别用来学、调参、最终打分。第 2 章
批次 / Batch一次喂给模型的样本组。"批量训练"= 攒一批再更新。第 2 章
轮次 / Epoch把整个数据集从头到尾学一遍 = 1 个 epoch。第 2 章
预训练 / Pre-training在海量通用数据上先学一遍(打基础),大模型的第一步。第 4 章
微调 / Fine-tuning在预训练基础上用专门数据小步接着学(定向培养)。第 5 章
指令微调 / Instruction Tuning用"问题-回答"对微调,让模型学会听指令(从接话变成回答问题)。第 5 章
RLHF用人类反馈打分再强化学习,让模型说话更讨人喜欢(对齐人的偏好)。第 5 章
强化学习 / RL(训练侧)靠"奖励信号"而非标准答案来学。第 1 章
激活函数 / Activation Function给神经元加"非线性"的小函数(如 ReLU),没有它多层≈一层。第 1 章
正则化 / Regularization防止死记硬背的"罚则"(如惩罚大参数),提高泛化。第 2 章
Dropout训练时随机"掐掉"一部分神经元,强迫模型学得更稳健。第 2 章
推理 / Inference训练完之后"用模型"算一次输出(大模型回答你的问题就是推理)。第 4 章

④ 大模型应用(约 15 条)

术语(中 / 英)一句话解释首次出现
★ 提示词 / Prompt你写给大模型的话;"提示工程"= 研究怎么写效果最好。第 8 章
★ 提示工程 / Prompt Engineering通过设计提示词引导模型输出(给出角色、约束、示例等)。第 8 章
★ RAG / 检索增强生成开卷考试:先查外部知识库,把相关内容塞进提示词再让模型回答。第 8 章
★ 智能体 / Agent能自己"想、调工具、做动作、看结果"的自动助理,而不是一问一答。第 8 章
工具调用 / Tool Calling模型不只会说话,还能调用函数/API(查天气、算数、查库)。第 8 章
函数调用 / Function CallingTool Calling 的早期叫法,模型输出"该调用哪个函数、传什么参"。第 8 章
向量数据库 / Vector DB专门存"向量"并支持相似度检索的库,RAG 的查字典工具。第 8 章
嵌入模型 / Embedding Model把文本/数据变成向量的模型,RAG 里负责"把资料变成可检索的向量"。第 8 章
上下文注入 / Context Injection把外部资料拼进提示词给模型"看",RAG 的核心动作。第 8 章
护栏 / Guardrails给 AI 系统设的"安全围栏":权限、审查、禁止项、人工确认。第 8 章
评估 / Evaluation给 AI 系统定期打分(准确率、覆盖率、用户满意度),防止"摆烂"。第 8 章
幻觉抑制 / Hallucination Mitigation用 RAG、给来源、限范围等手段减少编造。第 8 章
系统提示词 / System Prompt藏在后台的"角色设定":规定模型的身份和行为规则。第 8 章
少样本提示 / Few-shot在提示词里给几个示例(示范),模型照葫芦画瓢。第 8 章
思维链 / Chain-of-Thought让模型"先想后答",把推理步骤写出来,复杂题正确率大增。第 8 章

⑤ 工程与评估(约 12 条)

术语(中 / 英)一句话解释首次出现
★ Harness / 应用工程把模型包起来的整套"外围工程":提示、检索、工具、评估、护栏。第 8 章主题。第 8 章
API程序之间调用的接口;"调大模型 API"= 让程序直接请求模型服务。第 9 章
SDK厂商提供的开发工具包,让调用 API 更省事。第 9 章
Latency / 延迟从发请求到收到回答的时间,工程上要优化它。第 8 章
吞吐量 / Throughput单位时间能处理多少请求,监控系统关心这个。第 8 章
工作流 / Workflow把"人做的流程"固化成步骤化程序(如每日自动报表)。第 8 章
自动化 / Automation让系统定时/触发式替人干活,减少重复劳动。第 8 章
数据脱敏 / Data Anonymization去掉或替换敏感信息(姓名→编号),合规前提。第 9 章
版本控制 / Version Control给代码/提示词/数据存"历史版本",能回滚,工程基本功。第 9 章
监控 / Monitoring上线后持续观察系统表现(准确率下降?变慢了?)——你本行。第 8 章
回归测试 / Regression Test改动后跑旧用例,确保"没改坏原来的功能"。第 8 章
可解释性 / Explainability能说清楚"模型为什么这么判断"。大模型在这点上很弱。第 5 章

⑥ 其他模型家族(约 10 条)

术语(中 / 英)一句话解释首次出现
★ 线性回归 / Linear Regression找一条直线(或平面)拟合数据:x 变 → y 按比例变。第 7 章
逻辑回归 / Logistic Regression回归版"分类器":输出概率,判断是/否(如是否违章)。第 7 章
★ 决策树 / Decision Tree一连串"是/否"判断组成的分叉树,像倒闸操作判断流程。第 7 章
随机森林 / Random Forest很多棵决策树投票,稳、不容易过拟合。第 7 章
SVM / 支持向量机找一条"分得最开"的边界线把两类分开。第 7 章
K-means无监督聚类:把数据自动分成 K 堆,每堆找质心。第 7 章
KNN / K 近邻看离我最近的 K 个邻居怎么分类,我就怎么分(人以群分)。第 7 章
主成分分析 / PCA降维:把高维数据压到低维但尽量保留差异(省存储、可视化)。第 7 章
ARIMA / 时序模型经典时间序列预测:看"自己过去"的规律外推。第 7 章
编码器-解码器 / Seq2Seq"翻译机"结构:先读完全句,再生成另一句(Transformer 的前身理念)。第 3 章
使用建议:不用背,查就完了

术语表是字典不是课本——不要试图背下来。正确用法:读正文遇到陌生词 → 来这里查一句话解释 → 回到正文看它在上下文里的样子。查过两三次的词自然就记住了。真正要背的只有标 ★ 的约 20 个,它们构成了你与人交流 AI 的"最小词汇量"。