7.5 架构选型决策树:什么场景该用什么模型

1.选择多了,反而是个麻烦

前面几章我们把 2026 年主流的序列架构都过了一遍:Transformer、Mamba/SSM、RWKV、Gated DeltaNet、TTT、稀疏注意力、混合架构、7.4 节的位置编码 RoPE,还有 7.1 节的连续时间网络。选项一多,新手反而会懵——"我到底该用哪个?"

这一章不引入新架构,而是退一步,给你一份选型决策树。它不能替代你针对具体任务的实验,但能帮你快速排除明显不合适的选择,把精力集中到两三个候选上再细调。我把常见的任务场景分成几类,逐一给建议。

2.通用大语言模型(云端,追求最强能力)

首选:Transformer 或"循环为主+少量注意力"的混合架构。

如果你的目标是训一个通用的、能力对标 GPT/Llama 的大模型,而且算力充裕、不极端在乎推理成本,那么标准 Transformer 仍然是最稳妥的基线——它的生态最成熟、调参经验最多、能力上限经过反复验证。8.1–8.6 节要剖析的 DeepSeek、Kimi、Qwen、GLM,骨干都是 Transformer 或其变体(加了 MLA、稀疏注意力等优化,但本质还是注意力)。

如果你在乎长上下文和推理效率,且愿意承担一点工程复杂度,那就考虑混合架构(7.2 节):大部分层用 Mamba-2/线性注意力,只在少数层保留真注意力。Nemotron-H、Kimi Linear 都是这条路。它的好处是长上下文便宜、推理快,代价是训练流水线更复杂、调参经验不如纯 Transformer 多。另外不管选哪种架构,长上下文都得配上位置编码外推(7.4 节的 RoPE + YaRN/NTK),否则推理长度一超过训练范围位置编码就崩——这是和"算力够不够"并列的另一条硬约束。

3.边缘部署(手机、嵌入式,1GB 以下)

首选:连续时间网络(LNN/CfC)或小型混合模型。

如果你的模型要跑在手机、物联网设备、车载芯片上,显存和功耗是硬约束,那么 7.1 节的 LNN/LFM 是专门为这个场景设计的——它主打"1GB 以下的边缘大模型",在 CPU 上也能跑,且对不规则输入鲁棒。Liquid AI 的 LFM2 系列就是这个定位。

另一个选择是把一个小型混合架构(比如门控卷积 + 少量 GQA)量化到 4 比特(9.2 节),也能压到边缘可接受的体积。两者相比,LNN 在"可解释 + 不规则输入"上更强,量化小模型在"通用语言能力"上更强,看你最看重什么。

4.长序列时序信号(医疗、金融、传感器)

首选:连续时间网络或 SSM。

如果你的数据是时间序列——心电图、股价、工业传感器、事件相机——而且采样不规则、序列超长,那么 7.1 节的 LNN/CfC 几乎是为这个场景量身定做的,它的液体时间常数和连续时间机制能自然处理任意时间间隔。Mamba/SSM 也是很好的选择,它在线性开销下处理长序列的能力很强。

这两个里怎么选?如果可解释性重要(医疗诊断要给医生解释)、采样极度不规则,选 LNN;如果就是要把长序列压成一个表示做下游预测、不在乎解释,Mamba 通常更省事、生态更好。

5.需要精确检索/问答(RAG、长文档抽取)

首选:带稀疏注意力的 Transformer,或"少量真注意力"的混合架构。

8.x 节要讲的 RAG、长文档问答这类任务,对精确检索要求极高——模型必须一字不差地从几万字里捞出那个关键句。纯线性注意力/SSM 在这种精确回忆上仍比真注意力弱一截。所以这类场景不要为了效率全换成循环,至少要保留足够的真注意力层,或者用 NSA/DSA 这类可学习稀疏注意力(7.3 节)在保证精确性的前提下压开销。

6.生成式任务(图像/视频扩散、对话生成)

图像/视频扩散:骨干通常是 U-Net 或 DiT(扩散 Transformer),这和序列架构选择关系不大,用的是标准注意力 + FlashAttention。

对话/文本生成:和通用大模型一样,Transformer 或混合架构。生成任务对长上下文和效率的要求通常比理解任务更高(要逐 token 自回归),所以混合架构(循环为主)在长文本生成上越来越有性价比。

7.一张速查表

场景 首选 备选
通用云端大模型(不差钱) Transformer 混合架构
通用大模型(要效率/长上下文) 混合架构(循环+少量注意力) Transformer + 稀疏注意力
边缘/嵌入式(<1GB) LNN/LFM 量化小模型
不规则长时序(医疗/传感器) LNN/CfC Mamba/SSM
规则长时序(金融/日志) Mamba/SSM RWKV
精确检索/长文档问答 Transformer + NSA/DSA 混合架构(保留足够注意力层)
图像/视频扩散 U-Net / DiT

8.三条通用原则

不管具体选哪个,有三条原则几乎总是成立的:

第一,从基线开始。 不要一上来就追新架构。先用标准 Transformer 把流程跑通、把数据 pipeline 立起来、把评测做扎实,再考虑换骨干。新架构的收益往往没有"把数据和评测做好"的收益大。

第二,效率问题先问 FlashAttention 和量化。 很多人觉得模型慢就想换架构,但其实 80% 的效率问题靠 FlashAttention + KV cache 量化(9.2 节)+ 投机解码就能解决,不必动骨干。换架构是最后手段。

第三,混合是 2026 年的默认答案。 如果你拿不准,"大部分循环 + 少量注意力 + FlashAttention"这个配方几乎不会错——它在效率和能力之间取了当前已知的最佳平衡,这也是主流生产模型的实际选择。

9.练习

Q1. 一个要在手机上跑、处理用户语音指令的模型,你会推荐什么架构?为什么?

边缘 + 时序(语音采样不规则)场景,首选 LNN/LFM——它专为 <1GB 边缘设计、能处理不规则输入、CPU 友好。备选是量化到 4 比特的小型混合模型。

Q2. 一个要做长文档法律问答的 RAG 系统,为什么不该全换成线性注意力?

长文档问答对精确检索(一字不差捞出关键句)要求极高,纯线性注意力在精确回忆上仍弱于真注意力。应保留足够的真注意力层,或用 NSA/DSA 稀疏注意力在保证精确性前提下压开销。

Q3. 模型推理慢,第一反应该做什么,而不是急着换架构?

先上 FlashAttention(IO 优化)、KV cache 量化、推测解码这三件套,通常能解决大部分效率问题。换骨干架构是最后手段,且要先确保数据和评测基线扎实。

Q4.(面试题) 为什么说"混合架构是 2026 年的默认答案"?用效率-能力权衡解释。

纯 Transformer 能力强但 O(n2)O(n^2) 效率差;纯循环/线性注意力效率好但精确检索弱。"大部分循环 + 少量注意力"在长程效率(循环兜底)和精确检索(注意力保证)间取了当前最佳平衡,且叠加 FlashAttention 后工程成熟,主流生产模型(Nemotron-H、Kimi Linear、LFM2)都验证了这条路。

10.小结

第七卷到这里就讲完了。一句话收束:2026 年的架构前沿,是从"纯 Transformer 一统天下"走向"循环为主、注意力为辅、稀疏加速、组件可选"的混合范式。连续时间网络是美丽支流,SSM/线性注意力是主干替代,稀疏注意力和 FlashAttention 是工程加速器。下一卷我们把这些架构落地到具体的国产开源大模型上,看 DeepSeek、Kimi、Qwen、GLM 是怎么把这些组件组装起来的。

下一卷见。

相关标签
深度学习前沿架构架构选型工程实践