8.4 Qwen 系列:稠密与 MoE 双线,混合思考模式

1.Qwen 的位置:最全的开源家族

阿里通义千问的 Qwen 系列,是国产开源里覆盖面最广的一个家族——从几十亿的端侧小模型到几千亿的旗舰,从稠密到 MoE,从纯文本到视觉(VL),几乎每个档位都有对应的开源权重。到 2026 年中,主线已经从 Qwen3(2025 年 5 月,arXiv:2505.09388)演进到 Qwen3-Max 和 3.5/3.6/3.7 系列。这一章我们讲清 Qwen 最有影响力的一个架构创新——混合思考模式,以及它双线并行的产品策略。

2.混合思考与非思考:一个模型,两种模式

Qwen3 最被业界借鉴的创新,是把"深度推理"和"快速对话"塞进同一个模型,靠一个 chat template 切换。

在 Qwen3 之前,业界通常要维护两个模型:一个对话模型(GPT-4o 风格,快、直接回答),一个推理模型(o1/QwQ 风格,慢、先写长思维链再回答)。Qwen3 的做法是训练一个统一的模型,它支持两种模式:

  • 思考模式(thinking):模型先在 <think>...</think> 标签里写一段推理过程,再给出最终答案。适合数学、编码、复杂规划。
  • 非思考模式(non-thinking):模型直接给答案,不走思维链。适合日常对话、简单问答,快。

切换由 chat template 里的一个标志控制,用户或应用层决定用哪种。这一个设计的好处是部署成本减半——不用维护两套权重,一个模型按需切换。

3.Thinking Budget:给推理定个预算

配合混合模式,Qwen3 还引入了 thinking budget(思考预算)——一个可调的旋钮,控制模型在思考模式上花多少推理算力。预算给得高,模型思考得深、答案更准但更慢;预算给得低,思考得浅、更快但可能略糙。这让部署方能在延迟和质量之间灵活权衡,而不是被固定死。

这个思路和 Kimi K1.5 的 long2short 蒸馏、DeepSeek V3.1 的双模式是同源的——都是意识到"不能所有问题都让模型想几千 token",要能按问题难度动态分配推理算力。Qwen 把它做成了一个显式的、可调的预算参数,工程上很顺手。

4.稠密与 MoE 双线

Qwen 的产品线一直坚持稠密(dense)和 MoE 两条线并行

  • 稠密线:0.6B / 1.5B / 3B / 7B / 14B / 32B / 72B 等,全参数激活。适合中小规模部署、对延迟敏感、不需要超大能力的场景。稠密小模型(0.6B–7B)是端侧和边缘部署的热门选择。
  • MoE 线:30B-A3B(总参 30B 激活 3B)、235B-A22B 等规格,总参大、激活小,性价比高,适合需要大能力又要控成本的服务端场景。

这种双线策略让 Qwen 几乎覆盖了所有部署档位——从手机上的 0.6B 到服务端的 235B-MoE,开发者总能找到一个对路的规格。这也是 Qwen 在开源社区使用率一直很高的原因:选型时不愁找不到合适大小。

5.演进到 2026 年中

到 2026 年 7 月,Qwen 的状态:

  • Qwen3(2025.5):奠基的混合思考架构,稠密 0.6B–32B + MoE 30B-A3B / 235B-A22B,119 种语言,Apache-2.0 完全开源。
  • Qwen3-Max(2026 年初):API 旗舰, Thinking 变体对标最强推理模型,但没有独立 arXiv 技报,靠 model card 和 blog。
  • Qwen3.5 / 3.6 / 3.7 系列(2026):持续迭代,3.7-Max-preview 出现在 arena 榜单。还有 Qwen3-VL(视觉,4B/8B)、Qwen3-Turbo(256K–1M 上下文训练)等变体。

值得注意的是,Qwen 的"Max"旗舰目前主要是 API 形式(权重不一定全开),但中档(3B–72B)和 MoE(30B-A3B 等)的开源权重非常齐全,是开源生态里最厚实的。

6.练习

Q1. Qwen3 的"混合思考模式"解决了什么问题?相比维护两个模型有什么好处?

解决了"深度推理"和"快速对话"需要两套模型的问题。Qwen3 把两种模式塞进一个模型,靠 chat template 切换,部署成本减半(一套权重),不用维护对话模型和推理模型两份。

Q2. thinking budget 这个旋钮调节的是什么?为什么有用?

调节模型在思考模式上花的推理算力(思维链长度)。给高预算则思考深、准但慢;给低预算则浅、快但略糙。让部署方在延迟和质量间灵活权衡,而不是被固定死。

Q3. Qwen 为什么坚持稠密和 MoE 两条线并行?

为了覆盖所有部署档位:稠密线(0.6B–72B)适合中小规模、延迟敏感、端侧场景;MoE 线(30B-A3B / 235B-A22B)总参大激活小、性价比高,适合服务端大能力场景。双线让选型时总能有合适规格。

Q4.(面试题) Qwen、DeepSeek、Kimi 三家在"推理算力可控性"上各有什么做法?

Qwen 用显式的 thinking budget 参数;Kimi K1.5 用 long2short 蒸馏(把长链压成短链);DeepSeek V3.1 用思考/非思考双模式(一个 checkpoint 切换)。本质都是意识到不能对所有问题都花满推理算力,要按难度动态分配。

7.小结

Qwen 的核心贡献是把混合思考做成了标配范式(一个模型两种模式 + thinking budget),加上稠密/MoE 双线覆盖全档位,让它在开源生态里以"齐全"著称。下一篇我们看最后一家主力——智谱 GLM,以及它的异步 RL 和 agentic 路线。

下一章见。

相关标签
深度学习国产开源模型Qwen阿里混合思考