8.5 GLM/智谱:异步 RL 基础设施与 ARC 定位

1.智谱 GLM:专注 agentic 的那一拨

智谱(Zhipu / zai-org / THUDM)的 GLM 系列,是国产开源大模型里最专注"智能体(agentic)"方向的一支。到 2026 年中,主线从 GLM-4.5(2025 年 8 月,arXiv:2508.06471)演进到 GLM-5(2026 年 2 月,arXiv:2602.15763)再到 GLM-5.2(750B 总参 / 40B 激活)。GLM-5.2 在 arena 上排 agent 第 10、WebDev 第 6,和 Kimi K3 并列国产开源在软件工程智能体上的最强选手。

这一章我们讲清 GLM 两个最有辨识度的技术贡献:异步 RL 基础设施ARC 定位

2.异步 RL:把生成和训练解耦

GLM-5 技报的标题是 "from Vibe Coding to Agentic Engineering"(从氛围编程到智能体工程),点明了它的重心。在技术层面,GLM-5 最被业界关注的创新是异步 RL 基础设施

传统 RL 训练(包括 DeepSeek R1 用的 GRPO)里,生成和训练是串行的:模型先生成一批回答,算奖励,再更新参数,更新完再生成下一批……生成阶段 GPU 在算、训练阶段在等,训练阶段在算、生成阶段在等,两边互相阻塞,GPU 利用率上不去。在 agentic RL 这种场景下问题更严重——智能体要和环境多轮交互(跑代码、调工具、看结果),一轮交互就要很久,串行起来训练吞吐极低。

GLM-5 的异步 RL 把生成和训练彻底解耦:生成进程持续地往一个缓冲区里产出(轨迹, 奖励)样本,训练进程持续地从缓冲区取样本更新参数,两边各跑各的、不互相阻塞。这大幅提升了 RL 的吞吐量,尤其让 agentic RL(长轨迹、多轮交互)变得工程上可行。这是 GLM 对 R1 那套 RL 范式的重要工程升级。

3.DSA 稀疏注意力与成本控制

GLM-5 还采用了 DSA(DeepSeek Sparse Attention)风格的稀疏注意力来压低训练和推理成本,同时保持长上下文 fidelity。这和 7.3 节讲的 NSA 是同源的思路——用可学习的稀疏模式,在算得少的同时保持精确性。GLM 把它用在生产里支撑长上下文的智能体任务(比如读长代码库、操作长文档)。

4.ARC 定位:Agentic + Reasoning + Coding

GLM 的产品定位可以用三个词概括——ARC

  • Agentic:能自主规划和执行多步任务、调用工具、跑代码。
  • Reasoning:强推理能力(数学、逻辑)。
  • Coding:软件工程能力(SWE-Bench 这类基准)。

这三件事在 agentic 场景里是高度耦合的——一个软件工程智能体既要会推理(想清楚怎么改)、又要会编码(实际写)、又要会 agent(规划多步、调工具、验证)。GLM 把这三件事作为核心打磨方向,GLM-4.5 报告里 AIME-24 达 91.0%、SWE-bench Verified 达 64.2%,都是用 32B 激活的较小预算拿到了接近旗舰的成绩。这也是它在 arena 的 agent/WebDev 榜上排名靠前的原因。

5.GLM-5.2 与现状

GLM-5.2(2026 年中)是 750B 总参 / 40B 激活 的 MoE,被用作后续 CompactionRL(一种 RL 流水线,arXiv:2607.05378)的基座。GLM 这一脉的特点是技术报告写得很扎实(每代都有 arXiv 报告),开源权重齐全,是国产开源里文档和可复现性最好的一家之一。

和 DeepSeek/Kimi 比,GLM 更偏"软件工程智能体"这一垂直纵深——它的 ARC 定位让它在"让模型真的能干活、能写代码、能调工具"这个方向上投入最重,而不是追求通用对话的极致。

6.练习

Q1. 异步 RL 相比传统 RL,解决了什么问题?为什么对 agentic RL 特别重要?

传统 RL 生成和训练串行,互相阻塞,GPU 利用率低。异步 RL 把两者解耦到独立进程,各跑各的、用缓冲区传递样本。agentic RL 轨迹长、多轮交互耗时久,串行下吞吐极低,异步解耦后才工程可行。

Q2. GLM 的 ARC 定位指哪三个方向?为什么它们在 agentic 场景里耦合?

Agentic(自主多步任务)、Reasoning(推理)、Coding(软件工程)。agentic 场景里一个智能体既要推理(想怎么干)、又要编码(实际写)、又要 agent(规划调工具验证),三者高度耦合。

Q3. GLM、DeepSeek、Kimi 三家在技术侧重上的最大区别是什么?

GLM 偏软件工程智能体(ARC + 异步 RL);DeepSeek 偏架构效率(MLA/MoE/FP8 + R1 推理 RL);Kimi 偏长上下文 + 训练稳定性(MuonClip + Delta Attention)。

7.小结

GLM 用异步 RL 基础设施和 ARC 定位,在"让模型能干活"这个方向上走出了一条有别于 DeepSeek/Kimi 的路。三家国产主力各有所长:DeepSeek 架构效率、Kimi 长上下文稳定、GLM agentic 工程。下一篇我们补一家常被遗漏但技术过硬的主力——MiniMax。

下一章见。

相关标签
深度学习国产开源模型GLM智谱强化学习Agent