第 6 章 · 进阶视野(可先跳读,需要时再回)
大模型的替代技术路线
Transformer 统治了大模型时代,但它有一个结构性痛点:注意力复杂度 O(n²)。这一章回答:别人在用什么思路"绕开"或"补强"它?哪些是优化、哪些是真替代、哪些是训练之外的新方向?读完你再看 AI 新闻,就能看懂"为什么大家开始聊 Mamba、MoE、推理模型"。
6.1 痛点:注意力为什么贵?
4.2 节提过:自注意力要算"每个词 × 每个词"的匹配度。句子有 n 个词,就要算 n² 对——词数翻倍,计算量变 4 倍(O(n²))。
匹配对 ≈ 1 万
匹配对 ≈ 100 万
匹配对 ≈ 1 亿(窗口每大一点,成本爆炸)
图 6-1 O(n²) 的含义:长上下文(长文档、长对话、长视频)是注意力模型的"算力黑洞"
这就催生了四类应对思路:把注意力做快、绕过注意力、混合设计、以及把"知识"从模型里搬出去。
6.2 第一条路:把注意力做快(优化派)
不动注意力"机制",只让它跑得更快、更省:
- FlashAttention(闪速注意力):改的是"怎么在 GPU 里算"(分块、避免反复读写显存),效果完全等价,但快好几倍、省大量显存。今天主流大模型的训练和推理都在用——你天天用的模型,底层就是这个优化。
- 稀疏注意力:不让每个词看所有词,只让看"附近的词 + 随机抽样的一些远词"(如 Longformer、BigBird)。长文档省钱,代价是全局视野打折。
- 线性注意力(Performer 等):用数学技巧把 n² 降到 n(把 softmax 换成可拆解的形式)。理论很美,实际效果目前不如原生注意力。
6.3 第二条路:状态空间模型 Mamba(替代派)
如果不用注意力,怎么让序列里的信息"流动"起来?一条来自控制理论的老路——状态空间模型(SSM)——被重新激活,代表作就是 2023 年底横空出世的 Mamba[1]。
想象你(模型)在记流水账,手里只有一个小本子(状态 h),容量固定。每来一个新条目,你把"新信息"压缩进本子,同时丢掉本子里最不重要的旧条目——关键是要会判断"什么该留、什么该扔"。Mamba 的"选择性机制"就是:根据当前输入,动态决定每一条信息记多少、丢多少(比如出现"承包商"三个字时,立刻把前面所有"分包商"相关信息提高优先级)。
对比注意力:注意力是"开会时翻遍所有档案",Mamba 是"随身小本子 + 会抓重点的记法"。前者精确但费事,后者省事但可能漏记。
| Transformer 注意力 | Mamba(SSM) | |
|---|---|---|
| 复杂度 | O(n²),长文本贵 | O(n),长文本也便宜 |
| 全局视野 | 每个词真看到每个词 | 靠"小本子"压缩传递,可能漏 |
| 训练 | 全并行,快 | 可并行训练(硬件优化后) |
| 推理速度 | 每生成一个词都要回顾全部上下文,越生成越慢 | 状态固定大小,生成速度恒定(长对话优势明显) |
| 现状 | 统治地位,生态成熟 | 有亮点(超长上下文、低成本),但整体仍不及同等规模 Transformer |
6.4 第三条路:RWKV / RetNet(RNN 式替代)
另一派思路:回到 RNN 的形式,但用 Transformer 的训练方式训练。代表作 RWKV 和 RetNet:
- RWKV:把注意力"线性化"成一种带遗忘的递推(名字拆开:R=RNN 式递推,W=权重,K、V 来自注意力)。训练时像 Transformer 一样并行(快),推理时像 RNN 一样递推(状态固定,省显存、速度快)。
- RetNet:微软提出的类似思路,宣称兼顾训练并行、推理高效、长程能力。
一句话记忆:"想要 Transformer 的训练并行性 + RNN 的推理性价比",是这派共同的野心。它们目前是小众但认真的方向,Mamba 也有同类特性(并行训练 + 递推推理),三者算是"英雄所见略同"。
6.5 第四条路:混合与稀疏(MoE、SSM+注意力)
2026 年的现实是:没人急着推翻 Transformer,大家都在"组合"。
- 混合专家(MoE,Mixture of Experts):注意,MoE 不是替代注意力,而是把"前馈网络"那层换成几十上百个"专家网络",每次只激活其中 2–3 个。效果:模型总参数巨大(如 1.8 万亿),但每次推理只算一小部分——"兵多将广,但每次只点几个将"。GPT-4、DeepSeek、Mixtral 等都用了 MoE。这是当前"又大又便宜"的主流解法。
- SSM + 注意力混合(如 Jamba、Mamba-2 生态):一部分层用 Mamba(便宜、长程),一部分层用注意力(精确、局部)——混搭取长补短。未来大概率是"混合架构"的天下,而不是谁单挑赢谁。
普通模型 = 全能诊所:每个医生(神经元)都参与每个病例,人少活重。MoE = 三甲医院:全院医生名单很长(总参数大),但每个病人只由对应专科的 2–3 位专家接诊(稀疏激活)。医院"编制"大但忙得过来——这就是大模型界的"规模大 + 成本可控"。
6.6 训练之外的路线:推理时计算、检索、世界模型
除了"换个骨架",还有三条改变游戏规则的思路:
| 方向 | 机制一句话 | 代表 | 对你的启发 |
|---|---|---|---|
| 推理时计算 (test-time compute) |
生成答案前,让模型先"想很久"(内部生成推理链、自我验证),用推理时间换正确率 | OpenAI o1 系列及各家"深度思考"模式 | 难题(复杂分析)用"思考模式",简单问题别浪费——像你做重大判断时会多开会论证 |
| 检索增强 (RAG 等) |
知识不塞进参数里,需要时从外部数据库"现查"——模型只负责组织语言 | 企业知识库问答(第 8 章重点讲) | 解决"知识截止 + 幻觉"最务实的手段,直接服务你的规程问答场景 |
| 世界模型 | 让模型不只学语言,还学视频/物理规律,理解"世界怎么运转" | 视频生成模型、具身智能 | 长期方向;短期对你更实用的是"多模态"(直接"看"现场图片做初步分析) |
6.7 现实判断:2026 年谁在用?
- 主流仍是 Transformer + 优化 + MoE:所有你能叫出名字的闭源/开源大模型,骨干都是 Transformer 系(含混合架构),用 FlashAttention 提速、MoE 控成本;
- Mamba/RWKV 在特定赛道有优势:超长上下文、低资源设备、实时流式场景(语音助手、长时监控日志分析——和你"长时间运行数据流"的工作反而可能有缘分);
- 推理时计算是当前最热增量:"会思考的模型"成为新的竞争焦点。
不需要记住 Mamba 的数学,需要记住三句:① 注意力的贵(O(n²))是结构性的;② 替代方案的目标是"同样聪明、更省、更长";③ 2026 年的答案是混合与优化,不是推倒重来。至于选型——第 8 章会告诉你:你根本不用自己训练模型,选现成的、会调 API 就行。
6.8 本章小结
- 痛点:注意力 O(n²),长上下文是算力黑洞;
- 优化派:FlashAttention(等价但快)、稀疏注意力、线性注意力;
- 替代派:Mamba(SSM)——固定大小"小本子" + 选择性记重点,O(n);RWKV/RetNet——RNN 式推理 + 并行训练;
- 混合派:MoE(大编制、稀疏激活)、SSM+注意力混搭——当前主流答案;
- 训练之外:推理时计算(想久一点答更准)、RAG(知识外挂)、世界模型。
我刚学完"大模型的替代技术路线",请: 1. 用一句话分别解释:FlashAttention、Mamba、MoE、推理时计算,各配一个生活比喻; 2. 假设我要做"企业私有化部署一个长文档问答系统",比较 Transformer 和 Mamba 路线的取舍; 3. 出 2 道题考我:一道考 O(n²) 的含义,一道考 MoE 的机制,先别给答案。
自测题:配套《自测题与思考题》第 6 章 Q6.1–Q6.4。