8.3 Kimi K 系列:长上下文、MuonClip 与 K3

1.Kimi 的两条主线

Kimi 是月之暗面(Moonshot AI)的开源大模型系列,在国产开源阵营里和 DeepSeek 并列第一梯队。如果说 DeepSeek 的标签是"架构效率",那 Kimi 的标签就是**"长上下文"和"训练稳定性"**。从 2025 年初的 K1.5 到 2026 年 7 月刚发布的 K3,Kimi 沿着这两条主线一路演进,而且在 2026 年中的 arena 榜单上,K3 已经成为排名最高的国产开源模型

这一章我们顺着 K1.5 → K2 → K3 的脉络,讲清 Kimi 在每个阶段的核心技术贡献。

2.K1.5:长链思考 RL,刻意避开 MCTS

Kimi 在推理能力上的第一个重要工作是 K1.5(2025 年 1 月,arXiv:2501.12599),和 DeepSeek-R1 几乎同时,思路有相似也有不同。

K1.5 的核心是用长上下文作为 RL 的载体来做长链思考(long-CoT)强化学习。它有一个鲜明的工程选择:刻意避开了 MCTS(蒙特卡洛树搜索)、价值模型、过程奖励模型这些复杂组件——这些在 AlphaGo 时代很成功,但在大语言模型推理上既慢又难调。Kimi 证明了一条更简洁的路线也能达到对标 OpenAI o1 的推理水平。

K1.5 还引入了一个叫 "long2short" 的蒸馏技术:先用 RL 训出一个会写超长思维链的"long-CoT 模型",再把这些长链蒸馏成更短的思维链(short-CoT),让最终模型推理时不用写那么长也能保持效果——兼顾了推理质量和推理速度。

3.K2:MuonClip 与万亿参数零 loss spike

K2(2025 年 7 月,arXiv:2507.20534)是 Kimi 第一次把模型做到万亿参数级别(1T 总参 / 32B 激活的 MoE),预训练用了 15.5T token。这一代最被业界关注的技术贡献不是架构本身,而是一个训练优化器——MuonClip

万亿参数 MoE 的预训练有个要命的工程难题:loss spike(损失尖峰)。训练到一半,损失突然暴涨,整个训练就可能废掉重来,之前几十万 GPU 小时全打水漂。这在 2024–2025 年是所有大 MoE 模型团队的噩梦。

MuonClip 解决的就是这个问题。它在 Muon 优化器(一种基于矩阵正交化的新型优化器)的基础上,加了一个叫 QK-clip 的技巧——在训练过程中实时监控并裁剪 Q·K 注意力 logit 的尺度。研究者发现,很多 loss spike 的根源是注意力 logit 在训练中爆炸式增长,把 softmax 推成极端值、梯度炸掉。QK-clip 把这个 logit 尺度按住,spike 就消失了。K2 用 MuonClip 全程零 loss spike 训完了一个万亿参数 MoE,这在当时是工程上的里程碑。

配合大规模的 agentic(智能体)数据合成和联合 RL,K2 在 SWE-Bench Verified 上达到 65.8,刷新了开源模型在编码/智能体任务上的纪录。

4.K3:Delta Attention 与 Stable LatentMoE(2026-07-27)

K3 是我们写这一篇时昨天才发布的最新一代(2026 年 7 月 27 日,arXiv:2607.24653)。它把规模推到了 2.8T 总参 / 104B 激活,上下文做到 1M token,而且原生支持视觉(多模态)。在 2026 年 7 月 28 日的 arena 榜单上,K3(Max)排在 agent 第 3、WebDev 第 2,是当前排名第一的国产开源模型。

K3 的两大架构创新:

第一,Kimi Delta Attention + Attention Residuals。 这是 Kimi 为长上下文和深层网络设计的新注意力机制。Delta Attention 改进了信息在序列长度方向模型深度方向的流动;Attention Residuals 则是跨层的注意力残差连接,让深层也能稳定地获取早期的注意力信息。这是 Kimi 对 DeepSeek MLA / NSA 路线的回应——用自家的方案解决长上下文和深层稳定性的问题。

第二,Stable LatentMoE。 一种稳定化的潜在 MoE 路由,每 token 激活 896 个路由专家中的 16 个(比 K2 的配置更细粒度)。它和 MuonClip 的思路一脉相承——重点在"稳定"二字,保证大规模 MoE 训练不崩。

K3 报告称相比 K2 有约 2.5 倍的 scaling 效率(同样效果用更少算力),权重完全开源,post-training RL 覆盖通用、agentic、编码三个方向。

5.Kimi 的技术画像

把三代串起来看,Kimi 的技术画像很清晰:

  • 长上下文是一以贯之的标签(从 K1.5 的 long-CoT 到 K3 的 1M context)。
  • 训练稳定性是核心工程攻关(K2 的 MuonClip 解决 loss spike,K3 的 Stable LatentMoE)。
  • RL 路线偏好简洁(K1.5 刻意避开 MCTS/价值模型,走 long-CoT RL)。
  • 越来越重视 agentic/编码能力(K2 的 SWE-Bench,K3 的 agent 第 3)。

和 DeepSeek 比,DeepSeek 更偏"架构效率"(MLA/MoE/FP8),Kimi 更偏"训练稳定性 + 长上下文 + agentic"。两家路线不同,但都是 2026 年国产开源的第一梯队。

6.练习

Q1. K1.5 在做推理 RL 时,刻意避开了哪些组件?为什么这是个有勇气的工程选择?

避开了 MCTS、价值模型、过程奖励模型。这些在 AlphaGo 上成功,但在 LLM 推理上既慢又难调,还未必有效。K1.5 用更简洁的 long-CoT RL 路线达到了对标 o1 的水平,证明了复杂搜索不是必需的。

Q2. MuonClip 解决了什么问题?QK-clip 的原理是什么?

解决万亿参数 MoE 预训练的 loss spike 问题。QK-clip 实时监控并裁剪 Q·K 注意力 logit 的尺度——很多 spike 根源是 logit 爆炸把 softmax 推成极端值、梯度炸掉。按住 logit 尺度,spike 消失,K2 全程零 spike 训完。

Q3. K3 相比 K2 在架构上的两大创新是什么?

Kimi Delta Attention + Attention Residuals(改进信息和跨层注意力流动,支撑 1M 上下文和深层稳定),以及 Stable LatentMoE(稳定化的细粒度潜在 MoE 路由,每 token 激活 896 中 16 个)。

Q4.(面试题) 对比 DeepSeek 和 Kimi 的技术侧重,各有什么标签?这对选型有什么启示?

DeepSeek 标签是架构效率(MLA/MoE/FP8/无辅助损失),Kimi 标签是长上下文 + 训练稳定性(MuonClip/Stable LatentMoE)+ agentic。启示:要极致效率和 MoE 落地经验看 DeepSeek;要超长上下文和稳定训练大规模 MoE 看 Kimi。

7.小结

Kimi 用三代模型(K1.5→K2→K3)把"长上下文 + 训练稳定性 + agentic"这条路线走通了,K3 在 2026 年中成为国产开源榜首。它的 MuonClip、Delta Attention、Stable LatentMoE 都是针对大规模训练稳定性的硬核工程贡献。下一篇我们看另外两家国产主力——Qwen 和 GLM,它们又各自走了什么路。

下一章见。

相关标签
深度学习国产开源模型KimiMoonshot长上下文