57 个科目、15908 道题:MMLU 为什么成了大模型的「通用知识体温计」

57 个科目、15908 道题:MMLU 为什么成了大模型的「通用知识体温计」

在大模型评测的世界里,MMLU(Massive Multitask Language Understanding,大规模多任务语言理解)是一个绕不开的名字。从 2020 年发布至今,它几乎成了「这个模型知道多少」的代名词——几乎所有大模型的发布会、技术报告、排行榜,都会报一个 MMLU 分数。但 MMLU 的价值和局限,恰恰都藏在这个「通用知识体温计」的定位里:它曾经是大模型能力的黄金标准,如今则更多作为「基线」存在,并成了「基准饱和」和「数据污染」这两个问题的标志性样本。

数据集速览卡

项目内容
数据集名称MMLU(Massive Multitask Language Understanding)
发布机构UC Berkeley(Dan Hendrycks 等,联合 Columbia/UChicago/UIUC)
发布时间2020 年 9 月(论文 arXiv:2009.03300,ICLR 2021)
规模15908 道选择题,57 个科目
许可证MIT(Hugging Face:cais/mmlu)
用途定位大模型通用知识与推理的 zero-shot/few-shot 评测

背景:GLUE/SuperGLUE 之后,需要一把更难的尺子

MMLU 诞生于一个明确的动机:需要一把「更难」的尺子,来测量大模型在「知识广度」上的能力。

在 MMLU 之前,主流的语言理解基准是 GLUE 和 SuperGLUE。但到 2019-2020 年,最先进的模型在这些基准上已经迅速逼近甚至超过了人类基线——尺子「不够长」了。Hendrycks 团队意识到,需要一个新的基准,它能测的不再是「模型会不会做某个特定任务」,而是「模型在预训练阶段到底吸收了多少人类知识」。这个基准的独特之处在于:它要求模型在没有任务特定微调的情况下,仅靠预训练获得的知识来答题——就像考一个「没复习过的」学生。

MMLU 的题目来源也很有讲究:它们从真实考试材料里手工收集而来,包括 GRE、USMLE 这类标准化考试、AP 式的问题、牛津大学出版社的教科书题目,以及 ETHICS 数据集里的道德情境题。这意味着 MMLU 的题目贴近「真实的学术和专业考试」,难度从小学水平一直延伸到高级专业水平。

数据构成与规模

MMLU 的核心构成是「57 个科目、15908 道题」,这个数字组合有一个有趣的来历——57 这个数字,是刻意凑的「Atari 游戏的数量」。

57 个科目被组织成四个大类:

  • STEM:抽象代数、解剖学、天文学、大学计算机科学、大学数学、大学物理、电磁学、形式逻辑、高中物理、高中化学等。
  • 人文:历史、哲学、法律、道德情境等。
  • 社会科学:经济学、心理学、社会学、政治学等。
  • 其他:医学、商业、会计、专业认证、营养学、全球事实等。

题目总量 15908 道,被拆成三个切分:一个 few-shot 开发集(每个科目 5 道题)、一个验证集(1540 道题,用于超参数选择)、以及一个测试集(14079 道题,每个科目至少 100 道)。评测是在测试集上进行的。

每道题都是四选一(A/B/C/D)的选择题,因此随机猜测的准确率是 25%。这个设计意味着,一个模型要在 MMLU 上拿到高分,必须真的「知道」答案,而不是靠猜。

评测与使用方式

MMLU 的评测方式有明确的规定,这也是理解「MMLU 分数」的前提——不同评测协议下,同一个模型的分数可能差很多。

MMLU 的官方评测有两种:zero-shot(不给示例,直接答题)和 few-shot(给 5 个示例再答题)。few-shot 的 prompt 格式是:「The following are multiple choice questions (with answers) about [科目]。」然后跟上最多 5 个示例,模型给出它认为概率最高的选项(A/B/C/D)。官方排行榜大多报 few-shot 5-shot 的结果。

一个反复被强调、却常被忽略的点是:MMLU 分数对 prompt 措辞、评测 harness、评分方式极其敏感。zero-shot、5-shot、以及 chain-of-thought(思维链)三种方式测出来的分数,不能直接比较。所以读 MMLU 分数时,一定要看清楚:这是哪个协议下的分数?

在 Hugging Face 上,MMLU 以 cais/mmlu 发布(MIT 许可证),可以用 datasets 库直接加载。评测时,社区常用 lm-evaluation-harness 这类统一框架来跑,以保证结果的标准化。

演进:从「前沿区分器」到「基线体温计」

MMLU 最值得记录的,不是它的设计,而是它「地位的变迁」——这本身就是大模型能力跃迁的一面镜子。

2020 年刚发布时,大多数模型都在随机水平(25%)附近徘徊:GPT-2、RoBERTa、ALBERT 都在 20% 多。最大的模型才开始「脱离地面」:GPT-3 175B 在 few-shot 下达到 43.9%,而统一 QA 微调的 UnifiedQA 达到 48.9%。作者估计的人类专家水平是 89.8%(基于人类考生第 95 百分位),非专家约 34.5%。这个差距,说明 MMLU 在当时确实是一把「够长」的尺子。

但进步快得惊人。2023 年 3 月,GPT-4 在标准 5-shot 下达到 86.4%;2023 年底,Google 的 Gemini Ultra 报告了 90.04%,成为第一个超过「人类专家 89.8%」的模型——尽管这个数字用了 CoT@32 的协议,标准 5-shot 下是 83.7%。到 2024 年年中,GPT-4o、Claude 3.5 Sonnet、Llama 3.1 405B 等前沿模型,全部挤在 86-88% 的高位。

这个「挤在高位」的现象,就是「基准饱和」(benchmark saturation):当头部模型都接近满分时,MMLU 就无法再区分它们了。这正是 MMLU 从「前沿区分器」降级为「基线体温计」的原因——它现在更多被用来「快速检查一个模型是不是坏的、是不是没训练好」,而不是「比较前沿模型的强弱」。作者和社区也意识到了这一点,于是催生了 MMLU-Pro 等一系列更难的后续基准。

局限与争议

MMLU 的局限,主要集中在三个被反复讨论的问题上。

第一是数据质量问题。2024 年,研究者手动分析了 5700 道 MMLU 题目,发现约 6.5% 的题目在标注或措辞上存在错误。在某些类别里这个比例高得惊人——比如「病毒学」类别里,57% 的题有问题(多个正确答案、表述不清、或参考答案错误)。这意味着,即使一个「完美模型」也无法在原版 MMLU 上拿到 100 分,而某些「分数提升」可能反映的是模型「记住了系统性错误」而非「能力提升」。

第二是数据污染(contamination)。由于 MMLU 的题目来自公开考试材料,这些题目很可能已经进入了 LLM 的训练数据。如果模型「见过」答案,评测就不公平了——高分可能来自「背答案」而非「真理解」。

第三是选择题格式的局限。四选一的选择题,模型有时可以通过「排除法」或「捷径」猜中答案,而不需要真正的理解。这会系统性高估模型的真实能力。此外,MMLU 主要测「知识」,不太能测「推理」——一个「知识面广但不会推理」的模型,也可能在 MMLU 上拿高分。

为了应对这些问题,社区发展出了一系列衍生版本:MMLU-Redux(修正并重新标注的子集,2.0 版覆盖全部 57 个科目、5700 题)、MMLU-Pro(把选项从 4 个扩到 10 个、加入更多多步推理题,共 12032 题)、以及 C-Eval / CMMLU(中文版本)。这些衍生基准,本质都是在「修复 MMLU 的已知问题」。

横向对比同类基准

把 MMLU 和几个同类知识基准对比,能更清楚它的位置。

GPQA(2023)比,GPQA 是「研究生级、Google-proof」的 448 道题,专门设计成「搜不到答案、必须真推理」,定位是「前沿区分器」——它接替了 MMLU 饱和后留下的位置。和 MMLU-Pro 比,MMLU-Pro 是 MMLU 的「更难版」,10 个选项、更多推理题,分数比 MMLU 低 16-33 个百分点,目前是「中档模型比较」的常用工具。和 HumanEval(代码能力)比,HumanEval 测的是「代码生成」这一垂直能力,而 MMLU 测的是「通用知识广度」,两者互补而非替代。

一个可以提炼的规律是:在知识评测这条线上,MMLU 是「第一把够长的通用尺子」,它完成了「把大模型知识能力量化」的历史任务,但也最早撞上了「基准饱和」和「污染」这两个所有基准终将面对的问题。它之后的每个新基准,都是在解决它暴露出来的问题。

总结与使用建议

MMLU 今天的正确用法,不是「拿它比较前沿模型谁更强」,而是「拿它当快速体检」。它适合用来:快速检查一个模型「是不是坏的、是不是训练不足」;作为对齐后训练的「能力回归检测」(检查 RLHF/RLVR 后训练有没有让模型在通用知识上退步,即所谓的「对齐税」);以及作为「多语言能力」的英文参照点。

它不适合用来:比较 2024 年之后的前沿模型(已饱和);评估「推理能力」(它主要测知识);以及在不说明评测协议的情况下引用分数(zero-shot/5-shot/CoT 的分数不可比)。

MMLU 的 57 个科目:一张「人类知识地图」

MMLU 最容易被「57 个科目」这个数字带过,但它的价值恰恰藏在这 57 个科目的「选科」和「分层」里——它其实是在用一张「人类知识地图」来给大模型做「全身体检」。

从选科上看,57 个科目刻意覆盖了人类知识的四个象限:STEM(数理化、工程、计算机)、人文(历史、哲学、法律、道德)、社会科学(经济、心理、社会、政治)、以及其他(医学、商业、会计、专业认证)。这个覆盖不是随机的,而是为了让「知识广度」这个维度「没有死角」——一个真正「通用」的模型,应该在这四个象限都有不错的表现,而不是「偏科」。

从难度分层上看,MMLU 的题目从「小学水平」一直延伸到「高级专业水平」。比如同样是数学,既有「初等数学」(小学应用题),又有「抽象代数」(群论、环论、域论这种研究生课程)。这个「难度光谱」的设计,让 MMLU 不仅能测「模型知不知道」,还能测「模型知道得多深」——一个只懂皮毛的模型,会在「抽象代数」「专业医学」这类高难度科目上露馅。

一个很有意思的细节是,论文里那个著名的发现——能力是「随规模涌现」的。在 MMLU 上,GPT-3 的 13B 及更小版本,分数都在随机水平(25%)附近;只有 175B 的 GPT-3 XL 才「脱离地面」冲到 43.9%。这个现象,是「涌现能力」(emergent ability)最有力的证据之一——它说明某些能力(这里指「通用知识」),不是「线性增长」,而是「过了某个规模阈值才突然出现」。

还有一个值得注意的「弱项分布」:论文发现,模型在所有 57 个科目上都「低于专家水平」,而计算密集的 STEM(如大学数学,仅约 26%)和价值负载的科目(法律、道德)是最弱的。这个发现说明,2020 年的模型,在「需要精确计算」和「需要价值判断」这两类任务上,短板最明显——这两个短板,至今仍是 LLM 的经典弱点。

「基准饱和」与「污染」:MMLU 给整个评测领域上的两堂课

MMLU 的历史意义,不止于「它是一把尺子」,更在于它最早、最典型地暴露了「评测基准」这个物种的两个宿命性问题——「饱和」和「污染」。这两个问题,如今已经是整个 LLM 评测领域的核心议题,而 MMLU 是它们的「最佳教学案例」。

先看饱和(saturation)。MMLU 的分数,从 2020 年的「大多在 25% 随机水平」,到 2023 年 GPT-4 的 86.4%,再到 2024 年头部模型挤在 86-88%,只用了短短四年。当头部模型都逼近「人类专家 89.8%」的天花板时,这把尺子就「量到头」了——它无法再区分「谁更强」,因为大家都接近满分。这个「饱和」现象,是「静态基准」的宿命:只要一个基准是「固定的、公开的」,它迟早会被「刷满」。MMLU 是第一个大规模经历这个过程的基准,也因此成了「为什么要不断造更难的新基准」的最佳论据——MMLU-Pro、GPQA、ARC 这些后续基准,本质上都是在「MMLU 饱和之后」被逼出来的。

再看污染(contamination)。MMLU 的题目来自公开考试材料,这意味着它们极有可能已经进入了 LLM 的训练数据。如果一个模型在训练时「见过」MMLU 的题目和答案,那它考高分就可能是「背答案」而非「真理解」。这个「数据污染」问题,让 MMLU 的分数「可信度」大打折扣——你没法确定一个 88% 的分数里,有多少是「真本事」,有多少是「背过答案」。污染问题后来成了整个评测领域的「顽疾」,催生了「去污染检测」(decontamination)、「动态基准」(不断更新题目)、「私有评测集」(不公开答案)等一系列对策。

这两堂课合起来,给出了一个对「评测基准」的根本性认识:评测基准不是「永久有效」的,它是一个「消耗品」——它会被饱和、会被污染,所以需要不断「换代」。MMLU 是第一个把「基准的生命周期」完整走完的案例,它的「起高楼、宴宾客、楼塌了」的完整弧线,成了后来所有基准设计者的「前车之鉴」。

一份「快速上手」的使用清单

如果你今天要在项目里用 MMLU,这里有一份可操作的使用清单,帮你避开最常见的坑。

第一,明确你要的是「体检」还是「对比」。如果你的目的是「快速确认一个模型没坏、没训练不足」,MMLU 够用——它便宜、快、标准统一,是最省事的「冒烟测试」。但如果你的目的是「比较两个前沿模型谁更强」,MMLU 已经饱和,请换用 MMLU-Pro、GPQA 这类更难、还没饱和的基准。

第二,固定你的评测协议。MMLU 分数对协议极其敏感。zero-shot、5-shot、CoT 三种方式的分数不可直接比较。如果你要报 MMLU 分数,务必注明「用的是哪个协议、哪个 harness(如 lm-evaluation-harness)、哪个 prompt 模板」,否则分数没有参考价值。

第三,警惕「污染」。如果你的模型训练数据里可能包含了 MMLU 的题目(尤其是你用了大量公开考试语料训练),那 MMLU 分数可能「虚高」。对于严肃的能力评估,考虑做「去污染检测」,或改用「私有评测集」。

第四,把它当「对齐税」的检测器。这是 MMLU 一个常被忽略、却很有用的用途:在做 RLHF/RLVR 这类后训练时,用 MMLU 检测「对齐税」(alignment tax)——即后训练是否让模型在通用知识上「退步」了。如果后训练后的模型 MMLU 分数明显下降,说明对齐过程「牺牲」了太多通用能力,需要调整。

第五,别只看总分,要看「分科」。MMLU 的 57 个科目,是一个很好的「能力体检」维度。一个总分很高、但「大学数学」「专业医学」这类高难度科目很低的模型,说明它的「知识广度」是「浅层」的。分科看,能发现总分掩盖的短板。

参考来源

  • Hendrycks et al.《Measuring Massive Multitask Language Understanding》(arXiv:2009.03300,ICLR 2021)
  • Hugging Face:cais/mmlu
  • AICE Lab《The Complete Guide to LLM Benchmarks (2026)》
  • MMLU-Redux / MMLU-Pro 相关研究
主要菜单