7.2 现代线性注意力与高效循环:Mamba-2、Gated DeltaNet 与混合架构

1.Transformer 的阿喀琉斯之踵

3.8 节我们讲了 Transformer,它的核心是自注意力。自注意力让序列里任意两个位置都能直接交流,这是它碾压循环网络的根本原因。但这个能力是有代价的——注意力的计算量和序列长度的平方成正比O(n2)O(n^2)),因为每个位置都要和所有其他位置算一遍相似度。

序列一长,O(n2)O(n^2) 就成了灾难。处理一本 10 万字的书,注意力的计算量是处理 1 万字的 100 倍。更要命的是显存——注意力矩阵要存下来,n=10n=10 万时就是一个 101010^{10} 个数的矩阵,再大的显卡也装不下。这就是为什么 Transformer 在长文档、长视频、长代码这些场景上一直很吃力。

于是这几年整个领域都在找一件事:能不能有一种序列模型,既有 Transformer 那种"全局互看"的能力,又只有循环网络那种 O(n)O(n) 的线性开销? 这就是这一章的主线。到 2026 年,这条线上已经长出了一大片成果,而且它们已经不只是论文里的玩具——正以"混合架构"的形式进了生产级大模型。我们挨个看。

2.状态空间模型:从 Mamba 到 Mamba-2

3.11 节我们聊过 Mamba,它是选择性状态空间模型(Selective State Space Model)的代表。这里我们把它放在更大的图景里重新定位,并讲清楚它的进化。

状态空间模型(SSM)的核心是把序列建模成一个隐状态的递推:来一个输入,更新隐状态,再输出。最朴素的 SSM 是线性的(隐状态更新是个矩阵乘法),所以它天然是 O(n)O(n) 的——每一步只算一次矩阵乘,不回头和所有历史位置算相似度。但朴素线性 SSM 有个硬伤:它没法像注意力那样根据内容选择性地关注,所有信息一视同仁地塞进隐状态,长序列下信息很快就糊成一团。

Mamba 的突破在于"选择性"——它让 SSM 的参数(矩阵)变成输入相关的,网络可以根据当前输入决定"记住什么、忘掉什么"。这一下让线性复杂度的模型第一次拥有了接近注意力的内容选择能力。Mamba 的论文(Gu & Dao, 2023)一出来就成了爆款。

Mamba-2 的关键贡献是把这件事和注意力统一了起来。Dao 和 Gu 在 2024 年提出了结构化状态空间对偶(Structured State Space Duality, SSD),证明 SSM 其实可以看作注意力的一种变体——具体说,SSM 的隐状态更新等价于在一个半可分矩阵(semiseparable matrix)上做注意力。这个统一视角价值极大:它说明 SSM 和注意力不是两套对立的东西,而是同一个框架("在某种结构化矩阵上做序列混合")的两个特例。Mamba-2 借这个对偶把训练速度提了 2–8 倍,和 Mamba-1 比是实打实的工程胜利。

注意力:Y=softmax(QK)VSSM:Y=MV\text{注意力}:Y=\text{softmax}(QK^\top)V\quad\leftrightarrow\quad\text{SSM}:Y=MV

这里 MM 是一个结构化矩阵(SSM 视角),QKQK^\top 是另一个结构化矩阵(注意力视角)。SSD 说的是:选合适的 MM,SSM 就是注意力;选对 Q,KQ,K 的结构,注意力也能写成 SSM。两边在"结构化矩阵乘向量"这一层是同一个东西。

3.线性注意力家族:RWKV、DeltaNet 与门控

Mamba 走的是 SSM 这条路,另一条并行的路是线性注意力(Linear Attention)。它的想法是:把注意力的 softmax 去掉或近似掉,让 QKQK^\top 能先和 VV 结合,复杂度就从 O(n2)O(n^2) 降到 O(n)O(n)。这条路上有几个重要成员。

RWKV 是其中最"像 RNN"的。它巧妙地设计了两种模式:训练时可以像 Transformer 一样并行(train-parallel),推理时可以像 RNN 一样只维护一个固定大小的隐状态(inference-recurrent)。这样它既享受了 Transformer 的训练效率,又享受了 RNN 推理时的低显存。RWKV 从 2023 年的 RWKV-4 一路发展到 2025 年的 RWKV-7(Goose),一直在社区里保持活跃,是开源线性注意力模型里最有生命力的一个。

DeltaNet 走的是另一条思路,叫增量规则(delta rule)。它的隐状态更新不是简单的"加新信息",而是"加新信息的同时减去旧信息"——形式上像 SS+v(kSk)S \leftarrow S + v(k - S^\top k)^\top,这里 SS 是隐状态(一个矩阵),kk 是键,vv 是值。这个"写新抹旧"的机制让隐状态能更精准地更新,信息不会越积越糊。DeltaNet 把这个更新规则并行化,让训练也能高效。

Gated DeltaNet 是 2024 年底的关键进展,它把门控(gating,快遗忘)和 DeltaNet 的增量更新(精准写入)结合起来。门控负责快速清掉过时信息,DeltaNet 规则负责精准更新有效信息,两者配合在推理和长程检索任务上全面超过 Mamba-2。这条线在 2026 年还在快速迭代(Gated DeltaNet-2、Preconditioned DeltaNet 等不断出现),是目前线性注意力里最活跃的分支之一。

4.TTT:让隐状态本身成为一个模型

还有一个特别有意思的思路,叫 TTT(Test-Time Training,测试时训练)。它的想法激进而漂亮:不要用固定结构的隐状态,让隐状态本身就是一个模型(比如一个小线性网络),每来一个新输入,就用一个自监督损失在测试时对这个内部模型做一步梯度更新

ht=ht1η(ht1;xt)h_t = h_{t-1} - \eta\,\nabla \ell(h_{t-1}; x_t)

这里 hth_t 是隐状态(但它本身是个可微模型),\ell 是自监督损失,η\eta 是内循环学习率。每一步就是一次梯度下降更新隐状态模型。这种"隐状态即模型"的设计让表达能力暴涨——序列越长,隐状态模型被训练得越贴合数据,所以 TTT 在序列超过 16K 之后 perplexity 还在持续下降,而 Mamba 在那里基本平了。代价当然是每步要算一次梯度,但因为是线性模型的梯度,开销可控。

TTT 代表了一类新思路:让序列模型的记忆不再是静态矩阵,而是一个可学习的、随数据进化的子模型。这条线和 SSM、线性注意力是不同的技术路线,但目标一样——在线性开销下逼近注意力的能力。

5.2026 年的真实主流:混合架构

讲了这么多模型,你可能会问:到底哪个赢了?答案是——单靠任何一个都不够,2026 年真正占据主流的是"混合架构"

经验一再表明:纯循环/线性注意力模型在长序列上效率无敌,但在精确检索、近距离细节上还是比不过真正的注意力;而纯注意力效率太差。所以最聪明的做法是把它们按比例混着用。大致的配方是:大部分层用高效的循环/线性注意力,只在少数关键层保留真正的(软)注意力——业界俗称"70% 循环 + 30% 注意力"。

这个配方的真实落地证据很硬:

  • NVIDIA Nemotron-H 系列(2025)就是 Mamba-2 + MLP + 大约 4 层注意力的混合,有 8B 到 56B 多种规格,上下文做到 128K,性能对标 Llama 级别的稠密模型。
  • Kimi Linear(Moonshot,2025)把 Kimi 的骨干换成了线性注意力混合架构。
  • Liquid AI 的 LFM2 同样是"门控短卷积 + 少量分组查询注意力 + MoE"的混合,不是纯连续时间网络。

所以 2026 年的图景是:纯 Transformer 仍是基线,但追求效率的生产模型越来越多地走向"循环为主、注意力为辅"的混合架构。7.1 节讲的连续时间网络、本节讲的 SSM/线性注意力,都是这个混合配方里的候选组件。理解了这条主线,你再看任何新模型,都能把它归类到"它在哪几层用了什么组件"。

6.一张表收束主要成员

架构 核心机制 复杂度 代表作/产品
Transformer 全局软注意力 O(n2)O(n^2) GPT, Llama, Qwen
SSM / Mamba 选择性状态空间 O(n)O(n) Mamba-2, Jamba
RWKV 线性注意力,双模(并行训/循环推) O(n)O(n) RWKV-7
DeltaNet / Gated DeltaNet 增量规则 + 门控 O(n)O(n) Gated DeltaNet
TTT 隐状态即子模型,测试时梯度更新 O(n)O(n) TTT-Linear/MLP
混合架构 大部分循环 + 少量注意力 近似 O(n)O(n) Nemotron-H, Kimi Linear, LFM2

7.练习

Q1. 为什么朴素线性 SVM 在长序列上不如注意力?Mamba 用什么机制补上了这个短板?

朴素线性 SSM 参数固定,对所有信息一视同仁地写进隐状态,长序列下信息糊成一团,且无法根据内容选择性关注。Mamba 让 SSM 参数变成输入相关的(选择性),网络能决定记住什么、忘掉什么,从而获得接近注意力的内容选择能力。

Q2. Mamba-2 的 SSD(结构化状态空间对偶)说明了 SSM 和注意力之间什么关系?

SSD 证明 SSM 和注意力是"在某种结构化矩阵上做序列混合"这一统一框架的两个特例:SSM 等价于在半可分矩阵上做注意力,选对结构的注意力也能写成 SSM。这统一了两者,并让 Mamba-2 提速 2–8 倍。

Q3. RWKV 的"双模式"指什么,为什么有好处?

训练时用并行模式(像 Transformer 一样高效利用 GPU 并行),推理时用循环模式(像 RNN 一样只维护固定大小隐状态、省显存)。这样兼得 Transformer 的训练效率和 RNN 的推理低开销。

Q4.(大厂面试题) 为什么 2026 年的生产级大模型普遍采用"大部分循环 + 少量注意力"的混合架构,而不是纯循环或纯注意力?

纯循环/线性注意力在长序列效率无敌,但精确检索和近距离细节不如真注意力;纯注意力 O(n2)O(n^2) 效率差、长上下文显存爆。混合架构用循环层兜底效率和长程,只在关键层保留注意力保证精确性,在效率和能力间取得最佳平衡。证据是 Nemotron-H、Kimi Linear、LFM2 等生产模型都走这条路。

8.小结

这一章是 2026 年前沿架构的主干。记住三件事:SSM(Mamba-2)和线性注意力(RWKV/DeltaNet/TTT)是 Transformer 的线性高效替代;它们和注意力在 SSD 视角下是统一的;而 2026 年真实的主流是"循环为主、注意力为辅"的混合架构。下一篇我们继续往工程维度走,看长上下文和稀疏注意力怎么进一步压低注意力的开销。

下一章见。

相关标签
深度学习前沿架构线性注意力状态空间模型Mamba