第 5 章 · 建立正确预期
大语言模型的优势与劣势
Transformer 能做多大、多大才算"大"?大模型凭什么强、又注定弱在哪?这一章给你一套能力边界清单——知道它不能做什么,比知道它能做什么更重要(尤其你身处风险监控岗位)。
5.1 优势一:并行计算,训练快得离谱
第 3 章说过:RNN 必须一个词一个词串行读,长句子 = 长等待。Transformer 的注意力让所有词同时互相看——全部词对的匹配度一次性算完,天然适合 GPU 大规模并行。这是 Transformer 取代 RNN 的最直接原因:同样的时间里,Transformer 能"读"完多得多的文本,而"读得多"正是大模型能力的燃料。
5.2 优势二:长程依赖与全局视野
注意力让每个词能直接"看见"句子中任意远的另一个词,路径长度 = 1。对比 RNN 的"接力 N 次":Transformer 处理"第 1000 个词与第 2 个词的关系"和"第 1000 个词与第 999 个词的关系"成本一样。这带来两个能力:
- 长文档理解:读合同、读规程、对比长报表的上下文关联;
- 全局一致:写长文时记得开头埋的伏笔(虽然有限度,见 5.5 上下文窗口)。
代价是注意力复杂度 O(n²)——词数翻倍,计算量翻 4 倍。这正是第 6 章要讲的"替代路线"想解决的问题。
5.3 优势三:规模法则——大力出奇迹
深度学习有个反常识的发现:模型越大、数据越多、算力越强,性能几乎可预测地持续上升(在合理配置下)。这就是规模法则(scaling law)[1]:损失随规模呈平滑的幂律下降,而不是"到顶了"。
小模型像"只背了重点的实习生",大模型像"读完了全部历史档案的老专家"——而且这个"读完"的收益不是线性增长,是滚雪球。研究者还发现:参数、数据、算力三者要同步放大(Chinchilla 定律:数据量应约为参数量的 20 倍)[2]。只加参数不加数据,模型会"营养不良"。
规模法则解释了行业现象:为什么各家公司疯狂堆 GPU、堆数据——因为"大力出奇迹"在统计意义上是真的。
5.4 优势四:涌现与通用
规模跨过某个门槛后,模型会突然展现出训练目标里没有明说、也没有专门教过的能力——这叫涌现能力(emergent abilities)。典型例子:
- 训练目标是"猜下一个词",但它学会了翻译、写代码、数学推理、角色扮演;
- 给它一个任务,用自然语言描述清楚,它就能做——通用性(general-purpose)是传统模型没有的:同一个模型能写公文、做表格、分析文本、当翻译、当导师。
为什么会涌现?一个主流直觉:语言里浓缩了人类的全部思维模式,把"语言预测"练到极致,等于把其中蕴含的逻辑与知识一并"压缩"进了参数。这也解释了为什么大模型是"通用"的——它学的不是某个任务,而是"像人一样组织语言"这件事本身。
涌现的能力不等于可靠的能力。它"会"写代码,但可能写出有 bug 的代码;"会"算数,但可能算错。能力和可靠性是两回事——这条在 5.5、5.8 会反复强调。
5.5 劣势:六道硬伤
| 硬伤 | 本质原因(一句话) | 风险监控场景的后果 |
|---|---|---|
| ① 幻觉(hallucination) | 答案是"生成"的不是"查出来的",训练数据里没有或记错了,它也会流畅地编 | 让它"总结某起违章案例",它可能编出不存在的时间地点——致命。必须验证 |
| ② 知识截止 | 只学到训练结束那一刻;新规程、新政策、最新数据一概不知 | 问"今年新出的作业规程",它可能一本正经讲去年的旧版 |
| ③ 算力与成本 | 训练一次耗电以 GWh 计,推理也贵;"大"本身就是烧钱 | 企业内部部署大模型要考虑预算与机房条件(第 8 章会教你算"要不要自己搭") |
| ④ 上下文窗口有限 | 一次能"看"的文本有上限(几万到上百万 token 不等),超过的部分记不住 | 全年 12 个月的数据塞不进一次对话,需要拆、需要检索(→ 第 8 章 RAG) |
| ⑤ 不可解释 | 几千亿参数的决策路径无法像 if-else 那样审计 | "为什么判定这个作业为高风险?"——它给不出可复核的依据(目前研究在做可解释性,但远未成熟) |
| ⑥ 原生弱推理/弱计算 | 多位数乘法、多步逻辑易错;本质是"统计下一个词"而非"计算" | 让它直接算"三种结算口径的差异",大概率出错;正确姿势是让它写代码算(第 8 章工具调用) |
你每天的工作底线是"信息的可靠性"。请把大模型当成一个才华横溢但经常信口开河的实习生:它擅长起草、总结、发散、找思路;但凡是"要进报告的结论",一律要复核原始数据。这条纪律在第 8 章会变成具体的工程手段(评估 + 护栏)。
5.6 对话的底层机制:再谈"接龙"与温度
把 4.10 的机制和"网页对话体验"接起来,你会明白三件日常困惑:
- 为什么同样的问法,每次回答不一样?——因为生成是采样(按概率抽词,不是唯一解)。想要稳定,把温度调低、把问题写得更具体。
- 为什么它"懂"我的上下文?——网页版把你之前的对话内容拼进提示词,一起作为"接龙的起点"。聊天窗口越长,占的上下文窗口越多,太长就"忘"了开头(所以长篇对话后它经常前言不搭后语)。
- 系统提示词(system prompt)是什么?——开发者悄悄放在最前面的"角色设定",比如"你是一名严谨的电力安全分析师……"。你在网页版看到的"自定义指令/人设"就是它。第 8 章的 harness 工程,一大半工作就是打磨这层设定。
5.7 2026 年的模型版图(时效声明)
以下为2026 年 9 月的概况,只讲"家族与趋势",不讲具体型号排名(榜单每月都在变)[3]:
| 家族 | 代表 | 特点 |
|---|---|---|
| OpenAI GPT | GPT-5.x 系列(含推理模型) | 闭源第一梯队,通用+推理,生态最全(ChatGPT 全家桶) |
| Anthropic Claude | Claude Opus / Sonnet 系列 | 闭源,长文写作与编程口碑好,工程化文档规范(本书第 8 章参考其官方工程指南) |
| Google Gemini | Gemini 系列 | 闭源,多模态与超长上下文见长,与谷歌生态(搜索、云)深度绑定 |
| DeepSeek | DeepSeek 系列(V/R 分支) | 开源权重、性价比极高、推理模型对标第一梯队,中文能力强,国内部署首选研究 |
| 阿里 Qwen | Qwen 系列 | 开源权重,尺寸从 0.5B 到几百 B 全覆盖,中文生态活跃 |
| Meta Llama | Llama 系列 | 开源权重的"国际基准",全球开源社区围绕它构建 |
| 月之暗面 Kimi、智谱 GLM 等 | 国内新锐 | 长上下文、Agent 能力各有特色 |
值得注意的四大趋势(学完本书你就能看懂这些新闻):
- 推理模型(reasoning model)兴起:把"思考过程"也交给模型(o1 思路),推理时多花算力换取难题正确率——第 6 章"推理时计算"方向;
- 开源追赶闭源:DeepSeek、Qwen 等开源模型已逼近闭源第一梯队,成本低几个数量级——企业落地越来越现实;
- 多模态成为标配:文、图、音、视频一把抓,从"语言模型"走向"世界模型";
- 长上下文军备竞赛:从 8k → 128k → 1M+ token,但"窗口长"不等于"真能全用上"。
不必天天追新闻。每月看一次权威榜单即可:如 Mungo Mash 前沿模型追踪、AI Summit 模型对比。本书所有原理层面知识(第 1–4 章)不会过时,变的只是"哪个模型最强"这类新闻。
5.8 能力边界清单:能用它做什么,别用它做什么
| 放心让它做(提效区) | 必须小心(验证区) | 别让它做(禁区) |
|---|---|---|
| 起草/润色公文、总结长文 翻译、术语解释 生成 Excel 公式 / SQL / 代码 头脑风暴、方案初稿 把口语描述整理成结构化文字 教自己学新知识(当导师) |
事实性问答(要查证) 数值计算(要它写代码算) 涉及具体数据的结论(要核原始数据) 政策/规程解读(要对原文) 代码正确性(要跑测试) |
直接生成"要进正式报告的结论" 涉密数据的上传(注意数据安全) 没有任何验证通道的关键决策依据 替代人工复核(监控岗底线) |
放心区:让它把《XX 作业指导书》压缩成 3 页要点;让它给月报写开场白;让它把领导的口头要求整理成任务清单。
验证区:让它解读新版安全规程(必须对照原文);让它分析违章趋势(数据要它写代码算并核对)。
禁区:让它直接判定"某作业风险等级"并写入考核(不可解释、不可审计);把含员工隐私的违章明细直接粘贴进公共大模型(数据合规问题,第 8 章讲私有化部署)。
5.9 本章小结
- 优势:并行、长程、规模法则、涌现与通用——"大力出奇迹"有统计依据;
- 劣势:幻觉、知识截止、成本、窗口限制、不可解释、弱推理——六道硬伤,与生俱来;
- 对话底层 = 接龙 + 采样 + 温度 + 上下文拼接;
- 2026 版图:闭源(GPT/Claude/Gemini)+ 开源(DeepSeek/Qwen/Llama),趋势是推理模型、开源逼近、多模态、长上下文;
- 用前先问:这属于"放心区 / 验证区 / 禁区"哪一区?
我刚学完"大模型的优势与劣势",请: 1. 用大白话解释"规模法则"和"涌现能力",并各给一个反例说明其局限; 2. 假设我要把大模型用于"违章行为数据分析",按 5.8 的三区清单,给我 5 个具体用例,标出每个属于哪一区、为什么; 3. 出 2 道题考我"幻觉"和"上下文窗口",先别给答案。
自测题:配套《自测题与思考题》第 5 章 Q5.1–Q5.5。