8.6 MiniMax:闪电注意力与 CISPO 强化学习
1.常被遗漏的第四家主力
讲国产开源大模型,DeepSeek、Kimi、Qwen、GLM 这四家是常被提到的。但还有一家技术过硬、却常被一般学习者遗漏的——MiniMax。它在两个方向上有独到的硬核贡献:线性注意力(闪电注意力)和一种独特的 RL 算法(CISPO)。这一章我们把这两件事讲清楚,补全国产开源的版图。
2.闪电注意力:把长上下文做成线性成本
MiniMax-01(2025 年 1 月,arXiv:2501.08313)最招牌的技术是闪电注意力(Lightning Attention)。它本质上是一种线性注意力(7.2 节讲过这个家族),把注意力的 softmax 近似掉,让计算和 KV 存储都随序列长度线性增长而不是平方增长。
闪电注意力的工程意义在于它把线性注意力做到了超长上下文可用的成熟度:MiniMax-01 训练时用 1M token 上下文,推理时支持到 4M token。这是个很激进的数字——4M token 意味着可以一次塞进好几本长篇小说或一个中型代码仓库。能做到这个长度而不爆显存,靠的就是线性注意力的 特性。
MiniMax-01 是 456B 总参 / 45.9B 激活的 MoE,配上闪电注意力,定位是"超长上下文的高效模型"。它和 Kimi(长上下文 + 稳定训练)、DeepSeek(MLA 压缩 KV)是三种不同的攻长上下文路线——MiniMax 直接从注意力机制本身改成线性,最彻底。
3.CISPO:裁剪重要性采样权重,而非 token
MiniMax 在 RL 上也有一项独特贡献——CISPO 算法(用于 MiniMax-M1,2025 年 6 月,arXiv:2506.13585)。这是个 PPO 变体,专门为推理 RL 设计,核心创新在于裁剪的对象不同。
回忆 PPO/GRPO 的截断机制:为了不让策略更新步子太大,PPO 会对重要性采样比率 做截断(clip 到 )。GRPO 也是这个思路。
问题是:在推理 RL 里,思维链动辄几千 token,很多 token 的概率本来就低(罕见词、特定推理步骤)。标准的 token 级 clip 会把这些低概率 token 直接压死——它们一旦被 clip 到下界,梯度归零,模型就再也不会去探索这些"虽罕见但可能正确"的路径。这对推理质量是有害的。
CISPO 的创新是不裁剪 token 更新本身,而是裁剪重要性采样的权重。具体说,它调整的是样本在损失里的贡献权重,而不是直接掐断某些 token 的梯度。这样低概率 token 仍能被探索,训练更稳定,长思维链 RL 的效果也更好。MiniMax-M1 用 CISPO 在 512×H800 上以约 53.5 万美元的成本训出了支持 1M 上下文、40K/80K thinking budget 的推理模型。
4.MiniMax 的技术画像
把两条线串起来,MiniMax 的画像是:
- 长上下文走最彻底的线性注意力路线(闪电注意力,1M/4M token)。
- RL 走独特的权重裁剪路线(CISPO,保护低概率 token 探索)。
- 规模是 MoE 中型(456B/45.9B),不追极致旗舰,追"长上下文 + 推理稳定"。
到 2026 年中,MiniMax 已经迭代到 M2/M2.5/M3 系列,闪电注意力和 CISPO 仍是它的两大技术标识。
5.四家国产开源的对比
讲完 MiniMax,我们可以给四家国产开源主力做一个总对比,帮你建立全局印象:
| 维度 | DeepSeek | Kimi | Qwen | GLM | MiniMax |
|---|---|---|---|---|---|
| 架构标签 | MLA + MoE + FP8 | Delta Attention + Stable LatentMoE | 稠密/MoE 双线 + 混合思考 | DSA + 异步 RL | 闪电注意力 + MoE |
| 长上下文路线 | DSA 稀疏注意力 | 1M(K3) | Turbo 256K–1M | DSA | 1M/4M(线性注意力) |
| RL 标签 | GRPO(去 critic) | long-CoT RL(避 MCTS) | thinking budget | 异步 RL | CISPO(裁权重) |
| 特色定位 | 架构效率 | 长上下文 + 稳定 + agentic | 全档位齐全 | 软件工程智能体(ARC) | 超长上下文 + 推理稳定 |
这张表是这一卷的收束:五家各有侧重,没有绝对优劣,选型看你的场景最看重什么。
6.练习
Q1. 闪电注意力(MiniMax)和 DeepSeek 的 MLA 都在攻长上下文,路线有什么本质区别?
闪电注意力是线性注意力,从根本上改注意力机制(去 softmax),复杂度 ,最彻底;MLA 是保留 softmax 注意力的低秩压缩(KV 压到潜在向量),复杂度仍是注意力但 KV cache 大幅减小。前者改机制,后者压存储。
Q2. CISPO 相比标准 PPO/GRPO 的 clip,裁剪对象有什么不同?为什么这对推理 RL 重要?
标准 clip 裁剪 token 更新(低概率 token 被 clip 到下界后梯度归零,无法探索);CISPO 裁剪重要性采样权重而非 token 本身,低概率 token 仍能被探索。推理 RL 思维链长、含大量低概率但正确的步骤,保护它们不被压死对质量关键。
Q3.(面试题) 国产开源五家(DeepSeek/Kimi/Qwen/GLM/MiniMax)在长上下文上各走什么技术路线?哪种最激进?
DeepSeek 用 DSA 稀疏注意力;Kimi 用 Delta Attention + Attention Residuals(1M);Qwen 用 Turbo 训练(256K–1M);GLM 用 DSA;MiniMax 用闪电注意力(线性,1M/4M)。最激进的是 MiniMax——直接把注意力改成线性 ,做到 4M token,最彻底。
7.小结
MiniMax 用闪电注意力和 CISPO 补全了国产开源的技术版图。至此第八卷讲完——五家国产主力各有所长,构成了 2026 年开源大模型最活跃的阵营。下一卷我们转向工程落地,看怎么把这些模型真正部署、量化、搭成智能体、做评测和安全。
下一卷见。