配套 3 · 检验

自测题与思考题:专治"好像懂了"

每章 5–8 题,按理解 → 应用 → 电力场景三个层次设计。先闭卷作答,再点开答案。答案里不仅给结论,还解释"错在哪、为什么这么想"——看答案解析也是学习的一部分。

第 0 章 导引与学习审计

  1. ◎ 判断题:大模型是"搜索了一下互联网然后把答案抄给你"。对还是错?为什么?
    查看答案

    错。大模型不会"搜索",也不会"抄"。它是根据训练时学到的统计规律,逐词预测最可能的下一个词生成回答。它没有联网(除非接了工具),所有内容都来自内部参数。

  2. ◎ 选择题:学 AI 之前,你最该先补的基础是?

    A. 高等数学全部内容 B. 线性代数 + 概率 + 导数的基础概念(够用即可) C. 复变函数 D. 数论

    查看答案

    B。教材附录 A 的设计原则就是"够用即可":点积、矩阵乘法、概率、导数这四样补起来就够读完全书。高数里的积分、级数等暂时用不上。

  3. ★ 思考题:你部门现在的工作里,有哪些是"重复的、规则清晰的、可被模板化的"?这些就是 AI 最可能提效的对象——列 3 个。
    参考答案(示例)

    示例:① 每日作业计划核对(把计划表与风险点清单比对);② 周报/月报的初稿整理(从各系统导出数据拼报告);③ 违章记录的初筛分类。判断标准:人有明确规则 + 数据有结构 + 重复发生

  4. ◉ 判断题:学大模型必须会写代码。对还是错?
    查看答案

    错。理解原理、会用网页版对话、会做提示工程,完全不需要代码。代码是第三阶段(想搭工程、想自动化)才需要的工具——那时候再学也不迟,且有大模型当老师。

第 1 章 机器学习坐标

  1. ◎ 用你自己的话解释:监督学习、无监督学习、强化学习各是什么?各举一个电力场景的例子。
    参考答案

    监督学习=带标准答案的练习题(例:用历史违章记录+是否被通报,学"哪些特征→高风险");无监督学习=没有答案自己找结构(例:把光伏电站按发电特性自动聚成几类);强化学习=靠奖励试错学策略(例:训练自动电压控制策略,调好给奖励)。

  2. ◎ 选择题:神经网络的"权重(weight)"最合适的类比是?

    A. 电路里的固定电阻 B. 可调节的旋钮 C. 电容的容量 D. 变压器的变比(固定值)

    查看答案

    B。权重是训练过程中不断被调整的旋钮——训练就是"拧旋钮"的过程。A/D 都是固定的,忽略了"学习"这个关键特征。

  3. ◉ 思考题:为什么神经网络中间层必须加"非线性激活函数"(如 ReLU)?提示:回忆"两层线性变换可以合并成一层"。
    查看答案

    如果没有非线性,多层线性变换乘在一起还是线性变换——再深的网络也只相当于一层,无法表达复杂规律。激活函数像"开关"引入弯折,让网络能拟合任意形状的函数。

  4. ★ 场景题:你拿到 5000 条违章记录(时间、地点、作业类型、责任人、是否违章)。这属于什么学习类型?要回答"什么因素最可能导致违章",该用什么输入、什么输出?
    参考答案

    监督学习(有是否违章这个"标准答案"标签)。输入=特征(时间、地点、作业类型等),输出=是否违章(0/1)。这就是一个分类问题,第 7 章的随机森林就能做。

第 2 章 训练的本质

  1. ◎ 填空题:损失函数衡量的是__;训练的目标就是让它__。
    查看答案

    衡量"模型预测与正确答案差多远"(错得有多离谱);训练目标=让损失变小

  2. ◎ 梯度下降的"蒙眼下山"比喻里,下面哪项对应"学习率"?

    A. 山的形状 B. 每步迈多大 C. 山底的位置 D. 你站在哪里

    查看答案

    B。学习率=每步的步长。太大容易跨过谷底来回震荡,太小走得极慢。

  3. ◉ 反向传播解决的核心问题是什么?为什么"算梯度"必须从后往前算?
    查看答案

    解决"总错误如何分摊到每一层每一个旋钮"的问题。因为链式法则要求从输出端开始,把误差逐层往回"传递"(责任分摊),前面的层才能知道自己该往哪转。从前往后算会重复计算大量中间量,且信息不够。

  4. ◉ 过拟合的比喻是"死记硬背型选手"。请说出:它最典型的表现是什么?两个常用对策是什么?
    查看答案

    表现:训练集上几乎满分,测试集/新数据上表现明显变差(背答案背废了)。对策:① 增加训练数据;② 正则化/简化模型(限制模型复杂度,不让它背)。

  5. ★ 场景题:你要训练一个"光伏功率预测"模型。发现训练集误差很小但验证集误差很大。这是欠拟合还是过拟合?你第一个该试什么?
    参考答案

    过拟合(训练好、验证差)。第一个该试的通常是:加更多数据或正则化、简化模型;同时检查是否特征泄露(把"明天的辐照度"当特征就是作弊)。

第 3 章 序列与注意力

  1. ◎ 为什么文本、时序数据被称为"序列数据"?它对处理方式提出了什么要求?
    查看答案

    因为顺序本身就是信息("猫追狗"和"狗追猫"意思不同)。处理方式必须能感知先后顺序——这催生了"位置编码"等设计。

  2. ◎ 用"接力棒"比喻解释:RNN 为什么难以记住很长的句子里的早期信息?
    查看答案

    RNN 是信息接力传话:每到一个词,把上一个"记忆盒"的内容翻新一次再传给下一个。传得越远,早期信息被中间过程"稀释/覆盖"得越厉害——像接力棒经过 20 个人,最初那人写的信息早被改没了。

  3. ◉ 注意力机制的核心思想,用一句话概括是什么?
    查看答案

    处理每个词时,让模型自己决定"该看句子里的哪些其他词、各看多少"——用相关性权重来聚合信息,而不是死板的顺序传递。

  4. ★ 场景题:你读一份"违章通报":"李某在 10kV 线路上作业,未系安全带,被考核。"要判断责任类型,你读"未系安全带"时,会重点回看句子里哪些词?这恰好就是注意力在做的分配权重——试着说出 2–3 个词及理由。
    参考答案

    示例:会回看"作业"(判断是作业行为)、"考核"(后果)、"李某"(责任主体)。注意力机制就是把这种"人读句子时的关注点"自动化、数值化。

第 4 章 Transformer 架构

  1. ◎ 选择题:为什么不能直接把词本身喂给模型,而要先做"词嵌入"(embedding)?

    A. 词太长放不下 B. 模型只认数字,且需要让"意思相近的词坐标靠近" C. 为了保密 D. 嵌入可以压缩存储

    查看答案

    B。模型只会做数值运算;嵌入把词变成向量,且训练后能自动形成"相似词靠近"的空间结构——这是模型能理解语义关系的基础。

  2. ◎ 位置编码解决什么问题?为什么光有词嵌入不够?
    查看答案

    自注意力本身"不分先后"(打乱顺序结果一样),而语言里顺序很重要。位置编码给每个位置贴"座位号",让模型知道词的先后。

  3. ◉ 用"查字典"比喻解释 Q、K、V:如果我站在"值"的角度,一次注意力计算中,我到底是怎么被"找出并加权"的?
    参考答案

    Q 是"我的问题"(想找什么),K 是"我的标签"(供别人匹配),V 是"我的内容"(被取用的信息)。过程:每个词的 Q 与所有词的 K 算相似度(点积)→ softmax 变成权重 → 按权重把各词的 V 加权求和,得到我这个位置"结合全局后"的新表示。

  4. ◉ 多头注意力(Multi-Head)的"多"带来了什么好处?为什么说它是"多个专家开会"?
    查看答案

    单头只能学一种"关注模式"(比如只看语法关系);多头让不同头各学一种(有的盯语法、有的盯语义、有的盯指代),最后拼起来,覆盖更丰富的关联类型。

  5. ◉ 残差连接(Residual Connection)在架构里扮演什么角色?它的名字"抄近路"指什么?
    查看答案

    把层的输入直接加到输出上(x + f(x))。好处:① 梯度有一条"高速公路"直接流回浅层,缓解深层难训练;② 模型退化时层可以"退化成恒等"(什么都不做)。

  6. ◉ 为什么 GPT 这类"解码器"训练时要加因果掩码(mask)?它防止模型看到什么?
    查看答案

    防止模型"偷看答案":预测第 i 个词时,禁止它看第 i 个及之后的词。否则训练时模型直接抄后面的正确答案,学不会真正的预测能力。

  7. ★ 场景题:用"预测下一个词"的思路,解释为什么大模型回答你问题时会"越说越顺"(逐词生成)?
    参考答案

    模型每生成一个词,就把"已生成的部分"作为上下文,继续预测下一个词——像滚雪球。开头没定好,后面会越偏越远;这也是为什么提示词里把问题写清楚很重要。

第 5 章 大模型优劣

  1. ◎ 说出大模型相对传统 RNN 的至少 3 个核心优势。
    查看答案

    ① 并行计算(整句一起算,不用逐词排队);② 长程依赖(句子再长,任何词之间都能直接建立关联);③ 规模法则(参数/数据上去,能力持续提升,甚至涌现新能力)。

  2. ◎ 什么是"幻觉"?幻觉为什么无法根除(只能抑制)?
    查看答案

    模型一本正经编造不存在的事实。根因是:它的本质是"预测最可能的词",不是"查证事实"——只要编出来的话在统计上"像真的",它就可能说。所以只能通过 RAG、限定范围、给来源等方式抑制。

  3. ◉ 什么是"知识截止"?如果问你"昨天发生的停电事故",模型为什么可能答错?
    查看答案

    模型训练数据有截止时间,之后发生的事它"不知道"。且训练数据本身有筛选与滞后,所以"最近的事"要么不知道、要么靠猜(编)。需要 RAG/联网检索补充。

  4. ◉ "规模法则"和"涌现能力"是什么关系?能不能说"模型越大一定越好"?
    查看答案

    规模法则:能力随"数据×参数×算力"增长有可预测规律。涌现:规模跨过某个阈值后突然出现小模型没有的能力。但"越大越好"不成立:成本超线性增长、有收益递减区,且某些任务小模型+正确工具更划算(第 8 章决策矩阵会讲)。

  5. ★ 场景题:你想让大模型帮你写"光伏电站月度运行分析报告"。指出至少 2 个它可能出问题的环节,以及你该怎么防。
    参考答案

    ① 数据幻觉:它可能编造发电量数字 → 对策:所有数字必须由你的代码/报表算出,只让模型做"表达";② 知识截止/法规:可能引用过时标准 → 对策:把现行标准文本喂给它(RAG);③ 泄漏风险:把真实客户/合同贴给它 → 对策:先脱敏。

第 6 章 替代技术路线

  1. ◎ 自注意力的计算量随序列长度怎么增长?为什么这是个"痛"?
    查看答案

    O(n²):序列长度翻倍,计算量变 4 倍。长文档/长上下文时成本爆炸,这是人们找替代路线的主要动机。

  2. ◎ Mamba / 状态空间模型(SSM)的核心思路是什么?它想用什么样的复杂度替代 O(n²)?
    查看答案

    用"压缩的记忆状态"代替"和所有历史词直接比对":信息通过一个不断更新的状态向量流动,计算量随长度线性增长(O(n))。代价是"选择性"不如注意力灵活。

  3. ◉ 混合专家(MoE)不改变"注意力算法",那它省的是什么?怎么省的?
    查看答案

    省的是前馈层(FFN)的计算量:把一个大 FFN 拆成多个"专家",每个 token 只路由给其中 2 个左右专家算,其他专家不工作。总参数量巨大但每次推理只激活一小部分,兼顾容量与速度。

  4. ◉ 思考题:为什么这些替代路线目前都还没有完全取代 Transformer?
    参考答案

    因为注意力虽然贵,但"全局任意交互"带来的能力太强,且整个生态(硬件优化、训练框架、预训练经验)都围绕它成熟。替代路线往往在效率上赢、在能力/成熟度上输,目前多是"混合共存"而非"完全取代"。

第 7 章 其他模型家族

  1. ◎ 填空题:__回归用于"预测一个数值"(如发电量);__回归用于"判断是/否"(如是否违章),它输出的是__。
    查看答案

    线性(回归)用于预测数值;逻辑回归用于判断是/否,输出的是概率(0–1 之间,如"违章概率 87%")。

  2. ◎ 决策树为什么被称为"可以讲给人听的模型"?它和"倒闸操作判断流程"有什么相似?
    查看答案

    它是一连串"如果…就…"的判断分叉,规则可以直接读出来、画成流程图——和倒闸操作票、风险判断流程一样可解释、可审核。

  3. ◉ 随机森林和单棵决策树比,强在哪?它的"随机"体现在哪?
    查看答案

    强在:单棵树容易过拟合(对数据细节敏感),森林让很多棵树投票/平均,方差被压下来。随机=每棵树用的样本子集和特征子集都不同,保证树与树之间有差异(多样性才有投票价值)。

  4. ◉ K-means 属于哪种学习类型?"K"是什么?"mean"(质心)指什么?
    查看答案

    无监督学习。K=你想分成的堆数(提前给定);mean=每堆的中心点(该堆所有点的平均位置)。算法反复迭代:分堆→更新质心→再分堆,直到稳定。

  5. ★ 场景题:以下三个任务,你分别会选哪个模型家族?① 预测明天光伏出力(数值);② 判断一条作业是否高风险(是/否);③ 把 200 个电站按运行特征自动分组。
    参考答案

    ① 回归类(线性回归/时序模型/随机森林回归);② 分类类(逻辑回归/随机森林/决策树);③ 无监督聚类(K-means)。选型口诀:数值→回归,是/否→分类,没标签→聚类,要解释→树模型。

第 8 章 网页对话 vs 工程

  1. ◎ 说出判断"网页对话就够"还是"要搭工程"的五个问题(只要记住名字)。
    查看答案

    ① 频率与规模:一次还是天天/海量?② 时效性:要不要最新/内部数据?③ 正确性:错了代价多大?④ 自动化:要不要系统自己跑?⑤ 合规与安全:数据能不能出内网?——任何一项指向"需要系统化处理",就往工程走。

  2. ◎ 用"开卷考试"解释 RAG:它解决了大模型的哪个核心短板?
    查看答案

    解决"知识截止 + 幻觉 + 不知道内部资料":RAG 先检索相关文档(开卷),把内容塞进提示词再让模型回答(照着书答),答案可溯源、更准。

  3. ◉ Agent(智能体)和"一问一答的对话"本质区别是什么?
    查看答案

    对话是"问→答"就结束;Agent 是能自己规划步骤、调用工具、观察结果、循环执行直到完成任务——像给你跑腿的助理,而不是只回答问题的客服。

  4. ◉ 什么是"护栏"?为什么 AI 系统比传统软件更需要它?举两个例子。
    查看答案

    护栏=限制 AI 行为的规则与机制(权限、黑名单、人工确认、禁止动作)。因为模型输出不可完全预测,且可能主动"想办法",所以必须有外部约束。例:① 只给只读数据库权限,不许它删改;② 涉及考核/通报的内容必须人工确认后才发出。

  5. ★ 场景题:部门想让你做一个"违章记录自动问答"——员工在对话框问"最近一个月哪种作业违章最多?"。用五问判断:该用网页版对话,还是搭工程?搭的话最小方案是什么?
    参考答案

    五问走查:① 高频(天天有人问)→ 要工程;② 需要内部数据 → 网页版拿不到 → 要 RAG/接数据库;③ 答错可能误导考核 → 需要可溯源 → RAG 给来源;④ 可自动化 → 是;⑤ 数据敏感 → 必须内网。最小方案:内部 RAG 问答系统(向量库存违章库 + 大模型接口 + 只读权限 + 回答附来源)。

  6. ◉ 判断题:Prompt Engineering(提示工程)只能靠"玄学试错",没有系统方法。对还是错?
    查看答案

    错。有系统方法:角色设定、结构化指令(步骤)、少样本示例、思维链、格式约束、迭代评估(第 8 章 8.2 有完整清单)。试错是其中一环,但不是全部。

第 9 章 动手实践

  1. ◎ 三条实践路径按门槛从低到高排序是?
    查看答案

    ① 网页版大模型(零门槛)→ ② 在线 Notebook / Colab(浏览器跑代码,不用装东西)→ ③ 本地 Python(自己电脑装环境)。

  2. ◎ 代码报错时,最推荐的"初学者排错法"是什么?
    查看答案

    完整报错信息 + 相关代码复制给大模型,说"我是初学者,请解释报错原因并给出修改后的完整代码",并让它讲清原理——报错是对话的开始,不是学习的终点。

  3. ◉ 把真实数据喂给网页版大模型前,最该做的第一件事是什么?为什么?
    查看答案

    脱敏(姓名→编号、金额→归一化、去掉合同/人员身份证等)。因为公共网页版数据可能被用于训练或缓存,泄露后果自负。铁律:先脱敏,再外发;敏感数据只走内网。

  4. ★ 思考题:21 天小项目结束后,你的"交付物"应该包含哪四块?(提示:数据 → 模型 → 报告 → ?)
    参考答案

    ① 清洗后的数据集与处理说明;② 跑通的模型及指标(准确率/误差);③ 一页分析报告(数字必须来自代码输出);④ 自动化方案或"明确不该自动化"的结论——第 8 章五问的落地答案。四块齐了,就是一套可复用的方法论。

自测总原则

答对不是目的,暴露漏洞才是目的。答错后做三件事:① 回读对应章节小节;② 用自己的话把正确解释写一遍(不是抄);③ 过一周再答一次。真正掌握的标准是:你能给同事讲明白,且能经得住追问