附录 A · 按需查阅,不必从头读

数学速成:向量 / 矩阵 / 概率 / 导数

AI 需要的数学只有这四块,且全部可以用电力语言重新点亮:相量、节点导纳矩阵、故障率、负荷曲线斜率。每节最后回答"AI 为什么用它"。正文卡住时来查对应小节,十分钟就能接上。

A.1 向量:带方向的数,和"相似度"

A.1.1 向量是什么

向量 = 一串排好序的数,可以理解成两种东西(看场合用哪种都行):

维数就是数的个数:2 维向量管平面,768 维向量管"768 维空间"——想象不了没关系,数学上规则完全一样,你只需要把"768 个数打包成一串"这个动作。

电力场景对照:相量就是 2 维向量

你大学里学的相量(电压 U、电流 I 的幅值 + 相位角)就是 2 维向量:
U = (幅值, 相位)。两个相量相加(并联节点电压合成)、缩放(变压器变比),就是向量的加法和数乘。你早就用过向量,只是当时叫"相量"。

A.1.2 向量的三个基本操作

向量操作:人话 + 电力例子
操作人话电力例子AI 里在哪
加法 两个箭头首尾相接 KCL 节点电流合成 词向量叠加位置向量(第 4 章)
数乘(缩放) 箭头拉长/缩短 变压器变比 权重缩放、温度参数
点积(内积) 两个向量"方向有多一致":同向最大、垂直为 0、反向为负。公式 a·b = |a||b|cosθ,或对应位置相乘再相加 有功功率 P = UI·cosφ——就是电压向量和电流向量的点积!同相(φ=0)功率最大,正交(φ=90°)功率为零 注意力的核心:Q 和 K 的点积 = 匹配度(第 4.4 节)
点积 = 两个人方向一致的程度

两个人推一辆车:都朝车头方向(同向)→ 合力最大(点积最大);一个朝前一个朝旁边 → 白费一半劲;一个朝前一个朝后 → 抵消(点积为负)。点积衡量"两个向量是不是在同一个频道上"——注意力用这个当"相关度",天经地义。

AI 为什么用它:词向量是坐标点,"语义相近"= 方向相近 = 点积大。注意力里 Q(想找什么)和 K(我是什么)方向越一致,点积越大,softmax 给它的权重就越高。你不需要会算,只需要记住:点积大 = 相关

A.2 矩阵:一张表 + 一台变换机器

A.2.1 矩阵是什么

矩阵 = 一张排成方阵的数表,它同时是两种东西:

电力场景对照:节点导纳矩阵 Y

潮流计算里 I = Y·U:节点电流向量 = 导纳矩阵 × 节点电压向量。Y 矩阵把"电压向量"变换成"电流向量"——Y 矩阵就是一台"电压→电流"的变换机器,对角线是自导纳、非对角线是互导纳(各节点间的耦合)。
你在 Transformer 里看到的 W_Q、W_K、W_V 矩阵,干的是一模一样的事:把"词向量"变换成"查询/键/值向量"。

A.2.2 矩阵乘法:一句话规则

矩阵 A × 矩阵 B:结果第 i 行第 j 列 = A 的第 i 行 与 B 的第 j 列做点积。就这一条规则,其他全是它的重复。

比喻:矩阵 = 员工的岗位对照表

一个"任务×人员"矩阵,每一行是一个任务对每个人员的适合度打分;一个"人员×技能"矩阵,每一行是每个人员的技能画像。两者相乘,得到"任务×技能"矩阵——每个任务需要什么技能。矩阵乘法的本质是"两套信息通过中间层对接",Transformer 的每一层都在干这种"对接"。

AI 为什么用它:整个神经网络就是一连串矩阵乘法(每个权重矩阵 = 一台变换机器)。GPU 之所以快,就是因为它被设计成"矩阵乘法加速器"。你不需要会手算矩阵乘法——只需要看懂"矩阵是批量变换,乘法是信息对接"

A.3 概率:不确定性 + 贝叶斯

A.3.1 两个基础概念

A.3.2 贝叶斯定理:先验 × 证据 → 更新判断

贝叶斯定理(直觉版):

更新后的信念 = 先验信念 × 证据的支持度

数学式:P(A|B) = P(B|A)·P(A) / P(B)。不用背公式,记住流程:先有一个"先验"(原来怎么想),来了证据(B),按证据调整成"后验"(现在怎么想)

电力场景对照:故障诊断的贝叶斯

某变电站某类断路器平均故障率 2%(先验)。现在出现"保护动作"信号(证据 B)——它也可能是误动。把"保护动作时确实是故障"的概率(P(B|故障),灵敏度)和"无故障时保护也会动"的概率(P(B|无故障),误动率)代入,得到更新后的"这次大概率就是故障"(后验)。
你平时做"信号甄别"就是在做贝叶斯更新,只是没叫这个名字。

AI 为什么用它:三个地方。① 模型输出本来就是概率分布(softmax 之后每个词一个概率);② 朴素贝叶斯分类器直接用它;③ 现代大模型的"思维"里,本质上也在做"按上下文更新每种解释的概率"。记住一句话:概率 = 模型表达"不确定"的语言,softmax = 把一堆分数变成概率的机器

A.4 导数与梯度:变化率 + 下山方向

A.4.1 导数:瞬间的变化率

导数 = 曲线上某点的斜率 = "自变量动一点点,因变量变多少"。f'(x) 大 → 这里变化剧烈;f'(x)=0 → 这里是平顶/谷底/拐点。

电力场景对照:负荷曲线上的斜率

光伏出力曲线 6 点斜率很陡(太阳升起,出力猛涨),正午斜率≈0(出力到顶),傍晚斜率转负(出力下降)。斜率就是"此刻变化有多快、往哪个方向变"——你在监控里盯的"出力突变率",就是导数。

A.4.2 偏导与梯度:多变量时怎么走

模型参数有几千亿个,损失 L 是几千亿个变量的函数。偏导数 = 只让其中一个变量动一点点,看损失变多少(其他变量不动)。把每个参数的偏导数排成一串,就得到梯度 ∇L——一个指向"损失上升最快方向"的向量。

梯度下降(第 2 章主角):沿着梯度的反方向(下降方向)迈一步,重复上万次,就到损失谷底。学习率 = 步子大小。你可能忘了所有求导技巧,没关系——PyTorch 等框架会自动求梯度(自动微分),你要懂的是"梯度指方向、学习率定步长、迭代到谷底"这个直觉。

比喻:登山队找路

每到一个位置,用脚感受哪边最陡(梯度方向),往最陡方向迈一步(学习率),再感受再走。走到一个四周都比自己高、都比自己矮的"盆地底部"(局部最小)就停——这就是训练收敛。山沟可能不是全球最低(局部最优),但大模型参数多到一定程度后,实践中"差不多好的谷底"遍地都是,这个担忧没有想象中严重。

AI 为什么用它:训练的全部过程 = 反复计算损失对每个参数的梯度 + 沿反方向更新。附录 B.3、B.4 给出公式推导;正文只需记住:梯度是"下山的指南针",学习率是"步长",框架自动算指南针

A.5 一页总结:四块数学 ↔ AI 的对应

数学 ↔ AI 对照表(贴在桌上)
数学你的电力记忆锚点AI 里的角色
向量相量(幅值+相位)词向量:每个词一个坐标点
点积P = UI·cosφ注意力匹配度:Q·K 大 = 相关
矩阵导纳矩阵 Y:I = YU权重矩阵:批量变换;QKᵀ = 全员匹配
概率/条件概率故障率、保护误动率softmax 输出概率;贝叶斯式更新
导数/斜率出力曲线斜率损失变化率,决定参数往哪调
梯度山坡最陡方向训练指南针;框架自动算
给自己一个交代

当年补考过的数学,不是白学的——你缺的只是"把名字和用途接上"。现在接上了:你大学学过的每一个概念,都在这张表里找到了在 AI 中的座位。剩下的交给教材正文,卡住再回来。