MMLU 论文精读:57 个学科任务如何定义了大模型的「知识广度」考卷

MMLU 论文精读:57 个学科任务如何定义了大模型的「知识广度」考卷

今天几乎每发布一个大模型,官方都会在技术报告里报一个「MMLU 分数」。但很少有人去读这篇基准本身——Measuring Massive Multitask Language Understanding(MMLU),一篇 2020 年 9 月挂上 arXiv、后来被 ICLR 2021 收录的论文。读懂它,你才能明白为什么「57 个学科任务」这个数字会反复出现在每一个模型发布现场,以及它到底在考什么、又考不出什么。

一、论文速览卡

论文标题Measuring Massive Multitask Language Understanding
作者Dan Hendrycks, Collin Burns, Steven Basart, Andy Zou, Mantas Mazeika, Dawn Song, Jacob Steinhardt
机构UC Berkeley(加州大学伯克利分校)
arXiv2009.03300(2020 年 9 月 7 日提交,2021 年 1 月 12 日修订 v3)
正式发表ICLR 2021
任务规模57 个任务、共约 1.6 万道题,覆盖 STEM、人文社科、社会科学、其他四大门类
题目形式四选一选择题,few-shot(少样本)与 zero-shot(零样本)两种评测
一句话结论当时最强的模型(GPT-3)也仅比随机猜高约 20 个百分点,且在法律、道德等社会重要科目上接近随机水平,距离专家级能力还很远。

二、为什么这篇论文值得精读

MMLU 的价值不在算法创新,而在它第一次系统性地把「大模型到底懂多少」变成了一个可以反复测量的标准化问题。在它之前,评测存在两个老大难:一是基准太窄,单任务刷分容易、泛化能力测不出来;二是题目太简单,模型分数虚高、区分度不够。MMLU 用 57 个来自真实考试和教材的学科任务,把门槛一次性拉高到了「人类也得认真做」的水平。

更关键的是它的后劲。这篇论文发表时,最强的 GPT-3 175B 也才勉强超过随机基线约 20 个百分点;而短短三四年后,MMLU 分数一路从 40 多分涨到 80 多分、甚至接近 90,成为衡量「知识广度」的事实标准。可以说,MMLU 不仅是一张考卷,更是大模型知识能力成长史的一把刻度尺。

对做模型评测、选型、甚至是写技术文档的人来说,读 MMLU 论文能帮你搞清楚三件事:这 57 个任务到底包含哪些学科、题目从哪来、以及一个分数背后藏着哪些坑(比如校准、比如对社会科目的偏科)。更重要的是,它让你明白「MMLU 80 分」这个数字背后的真实含义——它到底代表了什么能力,又掩盖了什么缺陷。

三、背景:当时的评测为什么「不够用」

论文的动机在引言里写得很直白:当时衡量文本模型多任务能力的主流做法,要么是 GLUE、SuperGLUE 这类以自然语言理解(NLU)为核心的榜单,要么是各类单任务基准。它们有两个共同的局限。

第一,覆盖太窄。GLUE 时代衡量的是「语言理解」这个相对窄的能力,但真实世界里一个人被要求「有知识」时,指的是数学、物理、历史、法律、医学这一大堆学科的广度。一个只考 NLU 的榜单,测不出模型到底是不是「博学」。

第二,难度不足、区分度低。早期的很多任务在模型变强之后迅速饱和——大家都快满分了,分数就失去了比较意义。作者想造一个「在可预见的未来都不会被刷满」的基准,于是选择了「人类专业考试」这个难度锚点。

沿着这个思路,作者提出了 MMLU 的设计目标:既要广度(57 个学科),又要深度(题目来自真实考试/教材、达到专业水准),还要能同时测「会不会」和「知不知道自己对不对」。最后一点尤其有远见——它把「校准」这个后来才被重视的维度,早早埋进了基准的基因里。

四、核心方法:57 个任务是怎么搭起来的

4.1 题目来源:真实考试与教材

MMLU 的题目不是人工随手编的,而是从真实的、公开可获取的学科材料里搜集来的——包括各类标准化考试的练习题、大学课程的教材和在线资源。这保证了题目的「专业含金量」:它不是「苹果是什么颜色」这种常识题,而是需要真正学过该学科才能答对的题目。每一道题都是四选一的选择题,正确答案唯一。

这种「从真实考试取材」的设计,还带来一个附带好处:题目难度天然贴近「人类专业能力」的刻度。因为这些题本来就是用来考人类的,所以「模型在这张卷子上的分数」和「人类专家的分数」可以直接对比——这正是论文能得出「模型距离专家还有多远」这个结论的基础。57 个任务加起来一共约 1.6 万道题,规模足够大,避免了小数据集容易「刷分」的问题。

4.2 四大门类、57 个学科

57 个任务被组织成四大门类,覆盖了人类知识的主要版图:

  • 人文(Humanities):历史、哲学、文学、艺术、逻辑学、世界文明等;
  • 社会科学(Social Sciences):法律、政治、经济、心理学、地理、社会学、人类学等;
  • STEM:数学、物理、化学、生物、计算机科学、工程、医学、天文学等;
  • 其他(Other):商业、健康、会计、金融、全球事实等。

这个四门类结构是刻意设计的:它让研究者可以分门别类地看模型在哪个知识板块强、哪个板块弱,而不是只看一个总分。这也直接催生了论文里那个重要的发现——模型在不同学科上严重「偏科」。比如,模型在「抽象代数」「物理」这类结构清晰的理科科目上往往表现更好,而在「道德」「法律」这类涉及价值判断和社会规范的科目上则常常接近随机。这种「分学科诊断」的能力,是 MMLU 区别于单任务基准的核心价值之一。

4.3 评测方式:few-shot 与 zero-shot

MMLU 支持两种评测范式。一种是 few-shot(少样本):给模型看每门学科的几个示例问题(带答案),再让它答目标题目,论文标准设置是 5-shot;另一种是 zero-shot(零样本):不提供任何示例,直接答题。两种方式下都以「准确率」为指标。

在具体打分上,MMLU 的做法是「答案抽取 + 直接判对错」:把四个选项的文本分别拼进 prompt,看模型给哪个选项的生成概率最高,取概率最高的那个作为答案。这里其实藏着一个技术细节——这种「对比四个选项的概率」的评测方式,天然就带着模型的「置信度」信息,论文正是借此发现了「模型常常不知道自己错了」(校准差)这个问题。这个细节说明,MMLU 在出分的同时,也顺带考察了模型的「自知之明」。

五、实验结果:关键数据逐字保留

论文最有冲击力的结论,几乎都浓缩在摘要里的这几句话。原文写道:模型必须拥有 extensive world knowledge 和 problem solving ability 才能在这张卷子上拿高分;而现实是——

「We find that while most recent models have near random-chance accuracy, the very largest GPT-3 model improves over random chance by almost 20 percentage points on average.」

翻译过来就是:当时大多数模型的准确率接近随机猜(四选一即约 25%),只有最大的 GPT-3 模型平均比随机高约 20 个百分点。这看似是一句「模型还有救」的积极表述,但紧跟着作者就补了一刀:

「However, on every one of the 57 tasks, the best models still need substantial improvements before they can reach expert-level accuracy.」

也就是说,在全部 57 个任务上,最强模型距离「专家级准确率」都还有巨大差距。论文给出的具体参照是:当时最先进的模型(GPT-3 175B)few-shot 下约 43.9%,而人类专家的水平约 89.8%——中间隔着一道 40 多个百分点的鸿沟。这个「模型 vs 专家」的对比,比「模型 vs 随机」更能说明问题:模型不是「不会」,而是「远没到能用的专家水平」

此外作者还点出了几个细思极恐的观察:

  • 模型表现严重偏科(lopsided):不同学科之间的分数落差很大,理科明显好于社会科目;
  • 模型常常「不知道自己错了」(do not know when they are wrong):校准能力差,答错的题也答得「信心满满」;
  • 在道德、法律这类「社会重要」科目上接近随机(near-random accuracy on some socially important subjects such as morality and law)。

这几个结论放在今天看依然成立且重要:知识广度可以靠规模堆出来,但「知道自己懂不懂」的元认知能力,是另一个更难的维度。论文还观察到一个「规模与分数」的关系——模型越大,MMLU 分数越高,说明知识广度确实和参数量正相关;但即便最大的模型,也依然在「社会价值判断」类科目上捉襟见肘,这暗示了「知识」和「价值判断」可能是两套不同的能力。

六、局限与争议:这张卷子也不是万能的

MMLU 后来成了行业标准,但它的局限也在被反复讨论,这里如实列出几个最常见的批评。

第一,选择题形式限制了考察维度。四选一只能测「识别正确答案」的能力,测不出模型的生成质量、推理过程、以及面对开放问题时的真实水平。一个会「蒙对」的模型,未必真的理解。

第二,题目存在数据污染风险。随着训练语料越来越大,MMLU 的题目可能已经「泄漏」进某些模型的预训练数据里,导致分数虚高。这是所有公开基准都逃不掉的通病,MMLU 尤其明显——它太流行了,反而更容易被「背题」。

第三,饱和度问题正在逼近。作者当年想造一个「不会很快饱和」的基准,但顶级模型分数已经逼近 90,区分度正在下降。这也是为什么后来出现了 MMLU-Pro、MMLU-Redux 等更难的升级版。

第四,对社会学科的低分,未必是坏事。论文把「道德、法律接近随机」当作模型的短板,但也有人指出:这类题目本身的价值判断就存在争议,用「标准答案」去考模型,反而可能隐含偏见。

第五,评测协议本身有噪声。「对比四个选项概率」的答案抽取方式,对 prompt 的措辞、选项顺序都敏感,同一模型不同实现测出来的分数可能有几个点的浮动。这也是后来 HELM MMLU 这类工作要「标准化 MMLU 评测」的原因——连「MMLU 怎么测」这件事本身,都需要统一。

七、横向对比:MMLU 在评测基准里的位置

把 MMLU 放到整个评测基准的谱系里,它的定位会更清楚。

在它之前的 GLUE / SuperGLUE 是「自然语言理解」时代的旗帜,考察的是语言层面的理解能力;MMLU 则把焦点从「会不会读语言」切换到了「有没有知识」,覆盖面和难度都上了一个台阶。

和它同期的 BIG-bench 走的是「海量任务」路线(200+ 任务),强调任务的多样性与前瞻性,但题目质量和学科结构化程度不如 MMLU;HellaSwag、ARC 等则分别专注常识推理和科学推理,属于「专精」型。

在它之后,出现了一批「更难的 MMLU」:MMLU-Pro 把选项从 4 个加到 10 个、剔除简单题、加入更多推理,专门解决「MMLU 快饱和」的问题;GPQA 用研究生级的极难题目,把「知识深度」拉到极致;AGIEval、C-Eval 则把「多语言、考试化」的思路搬到了中文和高考/资格考试场景。这些后浪的共同点,都是在「知识广度」这条 MMLU 开创的赛道上继续加码。

MMLU 的独特之处在于:它是「学科知识广度」这个维度的定义者。所以尽管后来有了这么多「更难的变体」,大家在报告「综合知识能力」时,第一反应仍然是报 MMLU。某种意义上,MMLU 已经从一个「基准」变成了一个「约定俗成的度量单位」——就像「GDP」之于经济,你可以批评它不完美,但没人能绕过它。

七点五、评测协议的技术细节:一个分数是怎么算出来的

「MMLU 多少分」这句话听起来简单,但背后有一套值得了解的评测协议细节,理解它们你才能看懂「为什么同一个模型、不同地方报的 MMLU 分数会不一样」。

Prompt 模板。MMLU 的每个任务都有一个统一的选择题模板:给定题目 + 四个选项,模型要从中选出正确答案。few-shot 设置下,会在正式题目前面拼入该学科的几个「例题 + 正确答案」作为示范。模板的措辞(比如「Question: … Choices: A. … B. …」这种格式)虽然大体固定,但不同评测框架的实现细节会略有差异,这是分数浮动的一个来源。

答案抽取与打分。这是最容易「动手脚」、也最容易产生分歧的环节。MMLU 官方做法是「比较四个选项的生成概率」:把每个选项的文本分别接在题目后面,看模型给哪个选项的续写概率(logits)最高,取最高的作为答案。但后来很多评测改用「让模型直接输出 A/B/C/D,再解析字母」的方式,这两种方式在部分模型上会得出不同的分数。再加上「选项顺序是否打乱」「是否加正则约束」等细节,同一模型在「不同实现」下测出的 MMLU 分数,可能差出 1-3 个百分点。这正是 HELM MMLU 等项目要「重新标准化 MMLU 评测」的原因。

分数聚合。每个任务先算出该学科的平均准确率,再把 57 个任务的准确率做「宏平均」(macro-average,即各任务等权平均)得到总分。这种「按任务等权」的聚合方式,意味着「小数据量的冷门学科」和「大数据量的热门学科」在总分里权重相同——这是一种刻意追求「学科均衡」的选择,但也意味着总分对「冷门学科的波动」更敏感。

理解了这套协议,你就明白了一个重要的现实:「MMLU 分数」不是一个绝对客观的常数,而是一个「在特定评测协议下测出来的结果」。所以看模型对比时,最好确认双方用的是「同一套评测实现」,否则细微的分数差距可能只是「协议差异」,而不是「能力差异」。

七点六、一张考卷的「分数史」:从 43.9 到逼近 90

MMLU 最迷人的地方,在于它的分数记录本身就是一部「大模型能力成长史」。把这个演进过程拉出来看,比任何单个数字都更有信息量。

论文发表的 2020 年,GPT-3 175B 的 few-shot 分数约 43.9%,比随机基线(25%)高出不到 20 个百分点,而人类专家约 89.8%。当时的结论是「模型距离专家还差得很远」。

此后几年,MMLU 分数开始了一轮惊人的爬坡:随着模型规模扩大、训练数据优化、以及专门针对评测的改进(比如更好的 few-shot 适配、思维链式的答题策略),主流模型的 MMLU 分数从 40 多分一路涨到 60 多、70 多,再到 80 多。到了 2024-2025 年,顶级模型(包括各类旗舰闭源模型和开源模型)的 MMLU 分数已经普遍站上 85+,部分报告甚至逼近或超过 90,开始逼近当初设的「专家水平」参照线。

这条爬坡曲线,其实揭示了几个深层事实:其一,「知识广度」确实能靠规模和数据堆出来,这是 MMLU 分数持续上涨的核心驱动力;其二,分数上涨的边际速度在放缓,越接近 90 越难涨,说明「知识」这块的天花板正在被触及;其三,「评测技巧」也在贡献分数——有些上涨并不完全来自模型变聪明,而是来自「更会答题」(比如换 prompt、加思维链),这提醒我们对「高分」要保持一份清醒。理解了这段分数史,你就明白为什么 MMLU 已经从「还能不能考住模型」变成了「还能考出多大区分度」——它自己也在衰老。

八、MMLU 为什么能成为「行业默认」

一个基准能从论文变成「几乎所有模型都必报」的标准,背后有更深的原因,值得单独分析。我认为关键有三点:

第一,它恰好卡在「难度的黄金区间」。太简单的基准会很快饱和(失去区分度),太难的基准又让早期模型全部接近随机(也失去区分度)。MMLU 的难度,让 2020 年的 GPT-3 只有 43.9%,给后来的模型留出了「从 40 到 90」的漫长爬坡空间——正是这段爬坡空间,让 MMLU 在长达三四年的时间里始终保持区分度,成为模型能力的「有效刻度」。

第二,它「可读、可解释」。一个「57 个学科、四选一、准确率」的分数,任何非技术背景的人都能秒懂。「MMLU 90 分」比「某个复杂多指标框架下的 0.87」要好传播得多。这种「可读性」让它天然适合出现在发布会和技术报告里。

第三,它定义了「知识」这个被市场认可的能力维度。用户关心「模型是不是博学」,厂商需要一个能证明「我博学」的通用标尺。MMLU 恰好补上了这个生态位。这三点叠加,让 MMLU 从一个「研究基准」演变成了「行业基础设施」。

八点五、如何正确看待和使用 MMLU 分数

既然 MMLU 已经成了「行业默认」,那「怎么看它的分数」就成了一门必修课。这里给出几条可操作的判断准则,帮你避免被一个数字误导。

别只盯总分,要看分学科。一个 MMLU 总分 80 的模型,可能在 STEM 上 85、在社会科目上只有 70,也可能反过来。如果你要用模型做「法律/政策」类应用,看社会科目的分学科成绩,比看总分有用得多。论文早就揭示了「偏科」这个现象,可惜今天的发布会还是习惯只报一个总分。

警惕「评测协议差异」造成的分数水分。不同评测框架、不同的 prompt 模板、不同的答案抽取方式,都会让同一个模型的分数浮动几个点。看对比时,尽量确认双方用的是「同一套评测实现」,否则「差 2 分」可能只是「协议差异」。

警惕「数据污染」和「刷分」。MMLU 题目可能已泄漏进训练数据,有些模型可能「背过题」。如果一个模型的 MMLU 分数「高得离谱」、但换成 MMLU-Pro 或 GPQA 这类更难的变体就大幅跳水,那就要怀疑它是不是「记住了答案」而非「真的有知识」。

用「分数随时间的变化」而不是「单点分数」来判断趋势。单看一个模型的 MMLU 分数意义有限,但把它放进「从 43.9 到 90」的历史曲线上,你就能判断它处在什么位置、进步了多少。横向比排名、纵向比趋势,才是有信息量的用法。

总而言之,MMLU 是一把好尺子,但不是唯一的尺子,更不是「免检」的尺子。把它和 HELM 的多维评测、MMLU-Pro 的更难变体、以及真实任务上的表现结合起来看,才能逼近一个模型的真实水平。

九、总结:这篇论文留给我们三个启示

读完 MMLU,我提炼出三个对实践最有价值的判断:

第一,好基准的核心是「难度锚点」+「结构化覆盖」。MMLU 的成功在于用「真实专业考试」锚定了难度(不会很快饱和),用「四门类 57 学科」保证了覆盖面(能分门别类诊断强弱)。这给所有想自建评测的人一个清晰模板。

第二,一个分数永远不够,要看分学科、看校准。论文里「偏科」「不知道自己错了」这两个发现,比总分更能说明模型的真实水平。选型时别只看 MMLU 总分,要拆开看 STEM、看法律道德,甚至看模型的置信度校准。

第三,基准会老化,但「知识广度」这个维度不会。MMLU 可能因为数据污染和饱和而逐渐退役,但它确立的「测模型知道多少」这个问题意识,催生了一整个后续谱系。理解 MMLU,就是理解大模型评测这条线从哪来、往哪去。

参考来源

主要菜单