第 6 章 · 进阶视野(可先跳读,需要时再回)

大模型的替代技术路线

Transformer 统治了大模型时代,但它有一个结构性痛点:注意力复杂度 O(n²)。这一章回答:别人在用什么思路"绕开"或"补强"它?哪些是优化、哪些是真替代、哪些是训练之外的新方向?读完你再看 AI 新闻,就能看懂"为什么大家开始聊 Mamba、MoE、推理模型"。

6.1 痛点:注意力为什么贵?

4.2 节提过:自注意力要算"每个词 × 每个词"的匹配度。句子有 n 个词,就要算 n² 对——词数翻倍,计算量变 4 倍(O(n²))。

图 6-1 O(n²) 的含义:长上下文(长文档、长对话、长视频)是注意力模型的"算力黑洞"

这就催生了四类应对思路:把注意力做快、绕过注意力、混合设计、以及把"知识"从模型里搬出去。

6.2 第一条路:把注意力做快(优化派)

不动注意力"机制",只让它跑得更快、更省:

6.3 第二条路:状态空间模型 Mamba(替代派)

如果不用注意力,怎么让序列里的信息"流动"起来?一条来自控制理论的老路——状态空间模型(SSM)——被重新激活,代表作就是 2023 年底横空出世的 Mamba[1]

比喻:Mamba = 会自己挑重点的流水账本

想象你(模型)在记流水账,手里只有一个小本子(状态 h),容量固定。每来一个新条目,你把"新信息"压缩进本子,同时丢掉本子里最不重要的旧条目——关键是要会判断"什么该留、什么该扔"。Mamba 的"选择性机制"就是:根据当前输入,动态决定每一条信息记多少、丢多少(比如出现"承包商"三个字时,立刻把前面所有"分包商"相关信息提高优先级)。
对比注意力:注意力是"开会时翻遍所有档案",Mamba 是"随身小本子 + 会抓重点的记法"。前者精确但费事,后者省事但可能漏记。

注意力 vs Mamba(SSM)对比
Transformer 注意力Mamba(SSM)
复杂度O(n²),长文本贵O(n),长文本也便宜
全局视野每个词真看到每个词靠"小本子"压缩传递,可能漏
训练全并行,快可并行训练(硬件优化后)
推理速度每生成一个词都要回顾全部上下文,越生成越慢状态固定大小,生成速度恒定(长对话优势明显)
现状统治地位,生态成熟有亮点(超长上下文、低成本),但整体仍不及同等规模 Transformer

6.4 第三条路:RWKV / RetNet(RNN 式替代)

另一派思路:回到 RNN 的形式,但用 Transformer 的训练方式训练。代表作 RWKV 和 RetNet:

一句话记忆:"想要 Transformer 的训练并行性 + RNN 的推理性价比",是这派共同的野心。它们目前是小众但认真的方向,Mamba 也有同类特性(并行训练 + 递推推理),三者算是"英雄所见略同"。

6.5 第四条路:混合与稀疏(MoE、SSM+注意力)

2026 年的现实是:没人急着推翻 Transformer,大家都在"组合"

比喻:MoE = 三甲医院 vs 全能诊所

普通模型 = 全能诊所:每个医生(神经元)都参与每个病例,人少活重。MoE = 三甲医院:全院医生名单很长(总参数大),但每个病人只由对应专科的 2–3 位专家接诊(稀疏激活)。医院"编制"大但忙得过来——这就是大模型界的"规模大 + 成本可控"。

6.6 训练之外的路线:推理时计算、检索、世界模型

除了"换个骨架",还有三条改变游戏规则的思路:

三个"训练之外"的方向
方向机制一句话代表对你的启发
推理时计算
(test-time compute)
生成答案前,让模型先"想很久"(内部生成推理链、自我验证),用推理时间换正确率 OpenAI o1 系列及各家"深度思考"模式 难题(复杂分析)用"思考模式",简单问题别浪费——像你做重大判断时会多开会论证
检索增强
(RAG 等)
知识不塞进参数里,需要时从外部数据库"现查"——模型只负责组织语言 企业知识库问答(第 8 章重点讲) 解决"知识截止 + 幻觉"最务实的手段,直接服务你的规程问答场景
世界模型 让模型不只学语言,还学视频/物理规律,理解"世界怎么运转" 视频生成模型、具身智能 长期方向;短期对你更实用的是"多模态"(直接"看"现场图片做初步分析)

6.7 现实判断:2026 年谁在用?

对你而言,这一章的"及格线"

不需要记住 Mamba 的数学,需要记住三句:① 注意力的贵(O(n²))是结构性的;② 替代方案的目标是"同样聪明、更省、更长";③ 2026 年的答案是混合与优化,不是推倒重来。至于选型——第 8 章会告诉你:你根本不用自己训练模型,选现成的、会调 API 就行。

6.8 本章小结

读完本章,问大模型(复制可用)
我刚学完"大模型的替代技术路线",请:
1. 用一句话分别解释:FlashAttention、Mamba、MoE、推理时计算,各配一个生活比喻;
2. 假设我要做"企业私有化部署一个长文档问答系统",比较 Transformer 和 Mamba 路线的取舍;
3. 出 2 道题考我:一道考 O(n²) 的含义,一道考 MoE 的机制,先别给答案。

自测题:配套《自测题与思考题》第 6 章 Q6.1–Q6.4。