9.5 模型评测:OpenCompass、MMLU 与 Arena
1.评测为什么难
2.14 节我们讲过传统机器学习的评估指标(准确率、F1、AUC 这些)。但 LLM 时代评测变得棘手得多——模型输出是开放式的自然语言,"好不好"很难用一个客观公式量出来。"写一首关于秋天的诗"或"重构这段代码",没有标准答案,怎么打分?这一章我们讲清 2026 年主流的 LLM 评测方法。
2.客观题基准:MMLU 家族
最经典的一类评测是客观题基准——给模型出选择题,答对率就是分数。代表是 MMLU(Massive Multitask Language Understanding):涵盖 57 个学科(数学、历史、法律、医学……)的多选题,测模型的"知识广度"。中文版叫 CMMLU。
这类基准的好处是客观、可自动评分、好对比。缺点是:只测"知道什么",不测"能干什么";而且模型可能见过题(数据污染),分数虚高。所以衍生出很多变体:MMLU-Pro(更难)、GPQA(研究生级专家问答)、DROP(需要推理的阅读理解)等,都是为了把天花板抬高、减少污染。
3.能力专项基准
除了综合的 MMLU,还有针对特定能力的专项基准:
- 推理:GSM8K(小学数学应用题)、MATH(竞赛数学)、AIME(更难的数学)。
- 代码:HumanEval(写函数)、MBPP、SWE-Bench(修真实 GitHub issue,最接近"软件工程能力")。
- Agent:SWE-Bench Verified、WebArena(浏览器操作)、τ-bench(多轮工具调用)。
- 长上下文:Needle-in-a-Haystack(在海量文本里找一个特定事实)、LongBench。
- 多语言:MGSM(多语言数学)、Flores(翻译)。
注意 8.x 节我们引用的 Kimi K2 的 SWE-Bench 65.8、GLM 的 SWE-Bench 64.2,就是这些专项基准的成绩——它们比综合分数更能反映"在某个垂直任务上的真实能力"。
4.人类偏好:Arena 与 Elo 评分
客观题基准有上限(题目会被做完、被污染),而且测不出"人类主观感受"。于是有了 Arena(聊天大逃杀)——LMSYS 的 Chatbot Arena 是最有影响力的一个:两个匿名模型同时回答用户的问题,用户选哪个更好,系统用 Elo 评分(国际象棋那套)更新排名。
Arena 的价值在于:测的是真实人类偏好的综合感受,题目无限(用户随便问)、不固定、不可提前刷。它的排名(前面我们引用的 Kimi K3 排 agent 第 3、WebDev 第 2 就是 arena.ai 的)是 2026 年最被认可的"模型谁强"的参考。缺点是贵(要真人投票)、有噪声、容易受刷票影响。
5.OpenCompass:一站式评测工具
自己跑这么多基准很麻烦,OpenCompass(上海 AI Lab)是一个一站式评测工具:它集成了几十个基准、支持主流模型、能自动跑分出报告。国产模型团队基本都用它做内部评测。类似的还有 lm-evaluation-harness(Eleuther)。
评测的实践建议:不要只看一个分数。综合分(MMLU)看知识广度,专项分(SWE-Bench/GSM8K)看垂直能力,Arena 看人类偏好,三者结合才能对模型有全面判断。而且要在你自己的真实任务上测——通用基准再高,你的场景不一定对得上。
6.练习
Q1. MMLU 类客观题基准的优点和缺点各是什么?
优点:客观、可自动评分、好对比。缺点:只测"知道什么"不测"能干什么";模型可能见过题(数据污染)分数虚高;天花板有限。
Q2. Arena(Chatbot Arena)相比客观题基准,测的是什么?用什么评分方法?
测真实人类偏好的综合感受。两个匿名模型同时回答,用户选更好的,用 Elo 评分(国际象棋那套)更新排名。题目无限、不固定、不可提前刷,是 2026 年最被认可的"谁强"参考。
Q3. 为什么评测 LLM 不能只看一个综合分数?应该怎么组合?
综合分只反映一方面。要组合:综合分(MMLU)看知识广度,专项分(SWE-Bench/GSM8K)看垂直能力,Arena 看人类偏好,还要在自己的真实任务上测。
Q4.(面试题) 一个模型在 MMLU 上分数很高,但在你的 RAG 问答系统里表现差,可能的原因有哪些?怎么排查?
可能:(1) MMLU 测知识广度,RAG 要的是检索+理解+忠实度,能力维度对不上;(2) 数据污染让 MMLU 虚高;(3) RAG 的检索环节召回差,不关模型本身;(4) 模型长上下文/指令遵循弱。排查:在 RAG 专项基准(如 LongBench/τ-bench)上测、检查检索召回率、对比其他模型在同一 RAG 流水线里的表现。
7.小结
LLM 评测要"客观题基准 + 专项能力基准 + Arena 人类偏好 + 自有任务"四结合。OpenCompass 是一站式工具。下一篇我们讲安全与对齐——怎么让模型不胡说、不被越狱、不作恶。
下一章见。