自学教材 · 电力运营监控从业者定制版 · v1.0

从 Transformer 到大模型工程
一本讲给你听的 AI 自学教材

主结论:AI 并不神秘——它本质上是一个"从数据里找规律的大函数"。这本教材用直觉、比喻和你熟悉的电力语言(负荷曲线、潮流矩阵、相量),把 Transformer 的底层机制、大模型的优劣、其他模型家族、以及"什么时候直接跟大模型对话、什么时候要搭工程"一次讲透。你不需要多强的数学——附录 A 专门帮你把遗忘的线代、概率、导数补回来,数学推导全部收进附录 B 供学有余力时翻阅。

整套教材怎么串起来

教材按"一条主线"组织:先建立机器学习的直觉 → 讲清神经网络怎么学习 → 引出"注意力" → 拆解 Transformer 架构 → 讨论大模型的优劣与替代路线 → 认识更广阔的模型家族 → 落到你自己的工作场景(什么时候对话、什么时候搭工程)。前 4 章是地基,第 8 章是最贴近你工作的部分,附录和配套文件随时查阅。

图 0-1 教材依赖地图:前 4 章是地基,第 8 章最贴近运营监控工作,附录与配套随时查阅

章节总目录

第 0 章

导引与学习审计

审计你"没意识到需要补"的东西:数学、Python、以及最重要的心智模型——先纠正对大模型的五个误解。

必读约 40 分钟
第 1 章

机器学习坐标:从"程序"到"学会的程序"

机器学习是什么、三大学习范式、神经网络的最简形态。用"接线盒"和"乐高"建立第一层直觉。

必读约 50 分钟
第 2 章

神经网络如何学习:训练的本质

损失函数、梯度下降(蒙眼下山)、反向传播(责任分摊)。这是全书最需要耐心的两章之一。

必读约 60 分钟
第 3 章

序列问题与注意力:为什么需要"看全局"

文本是序列数据;RNN 的接力传话困境;从"顺序处理"进化到"注意力机制"的思想动机。

必读约 45 分钟
第 4 章

Transformer 架构详解:核心机制

词嵌入、位置编码、Q/K/V 自注意力、多头、残差、归一化;以及"预测下一个词"如何长出 ChatGPT。全书重头戏。

必读约 90 分钟,可拆两次读
第 5 章

大语言模型的优势与劣势

并行、长程依赖、规模法则、涌现——以及幻觉、算力、知识截止、不可解释。含"对话底层机制"与 2026 模型版图。

必读约 60 分钟
第 6 章

大模型的替代技术路线

注意力 O(n²) 的算力之痛;Mamba / 状态空间模型、RWKV、混合专家 MoE、推理时计算等方向。

进阶约 45 分钟
第 7 章

大模型之外的模型家族

线性回归、决策树/随机森林、SVM、K-means、CNN、RNN/LSTM、强化学习……每种一句话机制 + 理论 + 你的工作场景对照。

扫盲必备约 60 分钟
第 8 章

网页对话,还是搭工程?

判断清单 + 决策矩阵;RAG(开卷考试)、Agent(自动跑腿的助理)、评估与护栏;三个电力场景案例走查。

最贴近你工作约 70 分钟
第 9 章

动手实践指南

三条实践路径(网页版 / 在线 Notebook / 本地 Python)、让大模型当"导师"的问法、代码文件使用指引。

实践长期执行

数学附录(按你的要求:直觉为主,推导收起来)

四件套:计划 / 术语 / 自测 / 代码

三个学习建议

1. 先读第 0 章,再决定顺序

第 0 章是"学习审计":它告诉你需要补什么、哪些可以暂时不补。读过之后,按学习地图推进;数学卡壳时直接去附录 A 查对应小节,不用从头啃。

2. 每章读两遍,用自测题收尾

第一遍快速通读建立感觉,第二遍对照图 0-1 的地图画自己的笔记;读完翻开自测题对应章节,先闭卷作答再看答案。答不上来就回读,这是最有效的记忆方式。

3. 让大模型当你的私人导师

读完每章后,把该章末尾的"问大模型"提示词复制给任意网页版大模型,让它用费曼方法给你讲课、出题、纠正你的理解——这是本教材设计好的闭环。

4. 视频是"第二讲解员"

第 0 章和第 4、8 章内嵌了经过验证的 B 站视频清单(按入门/进阶分级)。文字卡住时看视频,视频卡住时回来看文字,两条路互相印证。