第 5 章 · 建立正确预期

大语言模型的优势与劣势

Transformer 能做多大、多大才算"大"?大模型凭什么强、又注定弱在哪?这一章给你一套能力边界清单——知道它不能做什么,比知道它能做什么更重要(尤其你身处风险监控岗位)。

5.1 优势一:并行计算,训练快得离谱

第 3 章说过:RNN 必须一个词一个词串行读,长句子 = 长等待。Transformer 的注意力让所有词同时互相看——全部词对的匹配度一次性算完,天然适合 GPU 大规模并行。这是 Transformer 取代 RNN 的最直接原因:同样的时间里,Transformer 能"读"完多得多的文本,而"读得多"正是大模型能力的燃料。

5.2 优势二:长程依赖与全局视野

注意力让每个词能直接"看见"句子中任意远的另一个词,路径长度 = 1。对比 RNN 的"接力 N 次":Transformer 处理"第 1000 个词与第 2 个词的关系"和"第 1000 个词与第 999 个词的关系"成本一样。这带来两个能力:

代价是注意力复杂度 O(n²)——词数翻倍,计算量翻 4 倍。这正是第 6 章要讲的"替代路线"想解决的问题。

5.3 优势三:规模法则——大力出奇迹

深度学习有个反常识的发现:模型越大、数据越多、算力越强,性能几乎可预测地持续上升(在合理配置下)。这就是规模法则(scaling law)[1]:损失随规模呈平滑的幂律下降,而不是"到顶了"。

比喻:规模法则 = 知识积累的复利

小模型像"只背了重点的实习生",大模型像"读完了全部历史档案的老专家"——而且这个"读完"的收益不是线性增长,是滚雪球。研究者还发现:参数、数据、算力三者要同步放大(Chinchilla 定律:数据量应约为参数量的 20 倍)[2]。只加参数不加数据,模型会"营养不良"。

规模法则解释了行业现象:为什么各家公司疯狂堆 GPU、堆数据——因为"大力出奇迹"在统计意义上是真的。

5.4 优势四:涌现与通用

规模跨过某个门槛后,模型会突然展现出训练目标里没有明说、也没有专门教过的能力——这叫涌现能力(emergent abilities)。典型例子:

为什么会涌现?一个主流直觉:语言里浓缩了人类的全部思维模式,把"语言预测"练到极致,等于把其中蕴含的逻辑与知识一并"压缩"进了参数。这也解释了为什么大模型是"通用"的——它学的不是某个任务,而是"像人一样组织语言"这件事本身。

涌现 ≠ 万能的

涌现的能力不等于可靠的能力。它"会"写代码,但可能写出有 bug 的代码;"会"算数,但可能算错。能力和可靠性是两回事——这条在 5.5、5.8 会反复强调。

5.5 劣势:六道硬伤

大模型的六道硬伤(对应你的工作场景逐个点评)
硬伤本质原因(一句话)风险监控场景的后果
① 幻觉(hallucination) 答案是"生成"的不是"查出来的",训练数据里没有或记错了,它也会流畅地编 让它"总结某起违章案例",它可能编出不存在的时间地点——致命。必须验证
② 知识截止 只学到训练结束那一刻;新规程、新政策、最新数据一概不知 问"今年新出的作业规程",它可能一本正经讲去年的旧版
③ 算力与成本 训练一次耗电以 GWh 计,推理也贵;"大"本身就是烧钱 企业内部部署大模型要考虑预算与机房条件(第 8 章会教你算"要不要自己搭")
④ 上下文窗口有限 一次能"看"的文本有上限(几万到上百万 token 不等),超过的部分记不住 全年 12 个月的数据塞不进一次对话,需要拆、需要检索(→ 第 8 章 RAG)
⑤ 不可解释 几千亿参数的决策路径无法像 if-else 那样审计 "为什么判定这个作业为高风险?"——它给不出可复核的依据(目前研究在做可解释性,但远未成熟)
⑥ 原生弱推理/弱计算 多位数乘法、多步逻辑易错;本质是"统计下一个词"而非"计算" 让它直接算"三种结算口径的差异",大概率出错;正确姿势是让它写代码算(第 8 章工具调用)
给监控岗的一句忠告

你每天的工作底线是"信息的可靠性"。请把大模型当成一个才华横溢但经常信口开河的实习生:它擅长起草、总结、发散、找思路;但凡是"要进报告的结论",一律要复核原始数据。这条纪律在第 8 章会变成具体的工程手段(评估 + 护栏)。

5.6 对话的底层机制:再谈"接龙"与温度

把 4.10 的机制和"网页对话体验"接起来,你会明白三件日常困惑:

5.7 2026 年的模型版图(时效声明)

以下为2026 年 9 月的概况,只讲"家族与趋势",不讲具体型号排名(榜单每月都在变)[3]

主要模型家族速览(2026-09,趋势性描述,型号迭代很快请以官方为准)
家族代表特点
OpenAI GPTGPT-5.x 系列(含推理模型)闭源第一梯队,通用+推理,生态最全(ChatGPT 全家桶)
Anthropic ClaudeClaude Opus / Sonnet 系列闭源,长文写作与编程口碑好,工程化文档规范(本书第 8 章参考其官方工程指南)
Google GeminiGemini 系列闭源,多模态与超长上下文见长,与谷歌生态(搜索、云)深度绑定
DeepSeekDeepSeek 系列(V/R 分支)开源权重、性价比极高、推理模型对标第一梯队,中文能力强,国内部署首选研究
阿里 QwenQwen 系列开源权重,尺寸从 0.5B 到几百 B 全覆盖,中文生态活跃
Meta LlamaLlama 系列开源权重的"国际基准",全球开源社区围绕它构建
月之暗面 Kimi、智谱 GLM 等国内新锐长上下文、Agent 能力各有特色

值得注意的四大趋势(学完本书你就能看懂这些新闻):

  1. 推理模型(reasoning model)兴起:把"思考过程"也交给模型(o1 思路),推理时多花算力换取难题正确率——第 6 章"推理时计算"方向;
  2. 开源追赶闭源:DeepSeek、Qwen 等开源模型已逼近闭源第一梯队,成本低几个数量级——企业落地越来越现实;
  3. 多模态成为标配:文、图、音、视频一把抓,从"语言模型"走向"世界模型";
  4. 长上下文军备竞赛:从 8k → 128k → 1M+ token,但"窗口长"不等于"真能全用上"。
怎么跟进最新动态(不焦虑版)

不必天天追新闻。每月看一次权威榜单即可:如 Mungo Mash 前沿模型追踪AI Summit 模型对比。本书所有原理层面知识(第 1–4 章)不会过时,变的只是"哪个模型最强"这类新闻。

5.8 能力边界清单:能用它做什么,别用它做什么

大模型能力边界速查(贴在你工位上)
放心让它做(提效区)必须小心(验证区)别让它做(禁区)
起草/润色公文、总结长文
翻译、术语解释
生成 Excel 公式 / SQL / 代码
头脑风暴、方案初稿
把口语描述整理成结构化文字
教自己学新知识(当导师)
事实性问答(要查证)
数值计算(要它写代码算)
涉及具体数据的结论(要核原始数据)
政策/规程解读(要对原文)
代码正确性(要跑测试)
直接生成"要进正式报告的结论"
涉密数据的上传(注意数据安全)
没有任何验证通道的关键决策依据
替代人工复核(监控岗底线)
电力场景对照:把这张表翻译成你的工作

放心区:让它把《XX 作业指导书》压缩成 3 页要点;让它给月报写开场白;让它把领导的口头要求整理成任务清单。
验证区:让它解读新版安全规程(必须对照原文);让它分析违章趋势(数据要它写代码算并核对)。
禁区:让它直接判定"某作业风险等级"并写入考核(不可解释、不可审计);把含员工隐私的违章明细直接粘贴进公共大模型(数据合规问题,第 8 章讲私有化部署)。

5.9 本章小结

读完本章,问大模型(复制可用)
我刚学完"大模型的优势与劣势",请:
1. 用大白话解释"规模法则"和"涌现能力",并各给一个反例说明其局限;
2. 假设我要把大模型用于"违章行为数据分析",按 5.8 的三区清单,给我 5 个具体用例,标出每个属于哪一区、为什么;
3. 出 2 道题考我"幻觉"和"上下文窗口",先别给答案。

自测题:配套《自测题与思考题》第 5 章 Q5.1–Q5.5。