论文速览卡
| 论文标题 | Holistic Evaluation of Language Models(语言模型的整体评估,简称 HELM) |
| 作者 | Percy Liang、Rishi Bommasani、Tony Lee、Dimitris Tsipras 等 50 余位作者 |
| 机构 | 斯坦福大学 HAI 旗下的基础模型研究中心(Stanford CRFM) |
| arXiv 编号 | arXiv:2211.09110(2022 年 11 月首版,2023 年 10 月修订 v2) |
| 正式发表 | Transactions on Machine Learning Research(TMLR),2023 年 |
| 核心贡献 | 提出一个「多指标、多场景」的标准化评测框架,用 7 个指标覆盖 16 个核心场景,对 30 个模型做密集评测,把大模型评测从「拼分数」拉回「看全貌」。 |
为什么值得精读
几乎所有做大模型的人都绕不开一个问题:怎么判断一个模型到底好不好?很长一段时间里,行业的答案是「看榜单」——MMLU 多少分、GSM8K 多少分、HumanEval 多少分。榜单方便,但它有一个致命的盲区:每个榜单只测一种能力,而且各家模型在不同榜单上的评测条件千差万别,你很难说清「A 比 B 强」这个结论到底在多大范围内成立。
HELM 这篇工作,就是冲着这个盲区去的。它没有再造一个更难的题,而是把「怎么评」这件事本身做成了系统:先给评测空间建立分类学,再定标准、定指标、定协议,最后对 30 个主流模型做了一次「在相同条件下」的密集评测。它公布的所有原始提示词、模型输出、评测代码全部开源,是一个能长期生长的「活基准」。理解 HELM,等于理解了大模型评测方法论的上限。
还有一层容易被忽略的价值:HELM 的写作本身就是一份「大模型评估的元研究」。它不只报告了 30 个模型谁强谁弱,更系统梳理了「评估一个语言模型,到底应该关心哪些维度」。对于要自建评测体系、或者要负责任地对外宣称「我的模型更好」的团队来说,这份清单比任何单一榜单都值钱。
背景:要解决什么问题
论文开篇点出一个尴尬的现状:语言模型正在成为几乎所有语言技术的基础设施,但我们对它们的「能力、局限和风险」其实并不清楚。作者在论文里用一句话概括了核心矛盾——在 HELM 之前,主流模型平均只在核心场景的 17.9% 上被评测过,甚至一些知名模型之间连一个共同评测过的场景都没有。这意味着,行业里大量「模型对比」的结论,其实建立在互相不可比的散装数据上。
具体来说,当时的评测生态有三个痛点。第一,指标单一:大家几乎只看准确率,校准度、鲁棒性、公平性、毒性、效率这些同样重要的维度被忽略。第二,场景覆盖不均:评测集中在几个热门基准上,大量真实使用场景没人测。第三,条件不统一:不同模型用不同的提示词、不同的 few-shot 设置,得出的分数不可直接比较。HELM 的目标,就是用一套标准化的协议把这三件事统一起来。
这里值得再往下想一层:为什么「条件不统一」这么致命?因为语言模型的输出对 prompt 极其敏感——同一个模型,换一种提示词、换一种 few-shot 示例、甚至换一个随机种子,分数都可能差出好几个点。如果各家在评测时各用各的 prompt,那「A 模型 80 分、B 模型 75 分」这个差距,到底是能力差距还是 prompt 运气差距,根本说不清。HELM 的标准化,本质上是把「prompt 这个隐藏变量」控制住,让分数差异真正归因于模型本身。
核心方法讲透
HELM 的方法论可以拆成三步,层层递进。
第一步,给评测空间建分类学。作者先把「可能的使用场景」(scenario,即任务/用例)和「关心的指标」(metric,即 desiderata,期望属性)两个维度都枚举出来,形成一个巨大的潜在评测空间。然后按「覆盖度」和「可行性」从中挑出一个子集,并明确标注哪些是缺失或代表性不足的——比如「被忽视英语方言的问答」「可信度指标」这些。这一步的价值在于:让「我们测了什么、没测什么」这件事变得透明,而不是假装评测是完备的。
第二步,采用多指标策略。这是 HELM 最核心的洞见。它对每个核心场景,尽可能同时测 7 个指标。论文强调,这套多指标测量在 87.5% 的场合都能落地,确保了「准确率之外的指标不会被边缘化」,也让不同指标之间的权衡关系暴露出来。此外还做了 7 个针对性评测(基于 26 个针对性场景),用来分析推理、虚假信息等特定方面。
这 7 个指标值得逐一拆开讲,因为它们定义了「语言模型好」这个模糊概念的具体内涵:
- 准确率(accuracy):模型答对的比例。这是最传统、也最直观的指标,但它只看「结果对不对」,不看「模型有没有自知之明」。
- 校准度(calibration):模型给出的置信度和真实正确率是否一致。一个校准好的模型,说自己「80% 确定」时,长期来看真的对 80% 次;校准差的模型则可能「迷之自信」或「过度谦虚」。这直接关系到人能否信任模型的判断。
- 鲁棒性(robustness):输入被轻微扰动(换词、加空格、改大小写、换说法)后,模型表现是否稳定。鲁棒性差的模型容易被「措辞」影响,换个问法就翻车。
- 公平性(fairness):模型在不同人群(性别、种族等)上的表现是否一致,是否存在系统性偏袒。
- 偏见与刻板印象(bias/stereotypes):模型是否会复现社会中的刻板印象,比如把「护士」默认关联女性、把「工程师」默认关联男性。
- 毒性(toxicity):模型生成的内容是否包含冒犯、仇恨、有害的语言。
- 效率(efficiency):达到一定效果所需的计算资源、参数量、推理成本。这是「能力强」和「划算」之间的权衡维度。
可以看到,这 7 个维度彼此独立又相互牵制:准确率高的模型未必公平,效率高的模型未必准确。单一榜单只能照出其中一两个,而 HELM 的野心是把它们同时摆上台面。
第三步,大规模标准化评测。作者选了 30 个有代表性的语言模型——覆盖开源、受限访问、闭源三类——在全部 42 个场景上跑了一遍。其中 21 个场景此前从未进入主流 LM 评测。评测全程使用标准化的提示词和条件,确保所有模型在同一把尺子下被衡量。这 30 个模型既包括 GPT-3、Jurassic-1、Cohere、Anthropic 这些闭源大模型,也包括 GPT-J、GPT-Neo、OPT、T5 等开源模型,覆盖了从几亿到上千亿参数的不同规模,形成了一个有代表性的横截面。
在技术实现上,HELM 提供了一套模块化工具链,把「生成补全 → 用指标打分」的过程抽象成可复用的流程,任何新模型、新场景都能挂进去。具体来说,它对每个场景定义了标准的适配器(adapter),把场景统一成「输入 → 补全 → 打分」三段式;新模型只要实现一个「生成」接口,就能复用全部场景和指标。这种工程化设计,让它成为一个社区可以持续贡献的活体基准,而不是一次性论文。
实验结果与关键数据
论文里有一组数字,是整个工作的「成绩单」,值得逐字记下:
覆盖率的跃升:在 HELM 之前,模型平均只在 17.9% 的核心 HELM 场景上被评测过,且一些知名模型之间甚至没有一个共同的评测场景;HELM 把这个数字提高到 96.0%——现在全部 30 个模型都在相同的核心场景和指标上、在标准化条件下被密集评测过。
指标与场景规模:7 个指标、16 个核心场景、7 个针对性评测、26 个针对性场景、30 个模型、42 个场景(其中 21 个此前未用于主流 LM 评测)。
结论沉淀:评测最终提炼出 25 条顶层发现(25 top-level findings),覆盖准确率与效率的权衡、校准度普遍不佳、偏见与毒性的模型间差异等。作者为求透明,还公开了所有原始模型提示词与补全结果,供社区进一步分析。
这 25 条发现里,有几条尤其有启发性,值得展开:
- 准确率和效率往往呈反比:更强、更准的模型,通常参数更多、算力更贵。没有哪个模型能在所有维度上「既准又省」,选模型本质上是在做权衡。
- 校准度普遍不佳:当时多数模型的置信度和真实正确率对不齐,普遍存在「过度自信」,这为后来「让模型学会说不知道」的研究埋下了伏笔。
- 偏见和毒性因模型而异,且与准确率无关:一个准确率很高的模型,可能在毒性或偏见上表现很差。这说明「能力强」和「行为安全」是两个正交的问题。
- 提示词的敏感性:模型对 prompt 的措辞敏感,标准化评测能显著降低这种噪声对结论的干扰。
值得注意的是,HELM 的价值不在「谁拿了第一」,而在它把「准确率之外」的维度摆到了台面上。例如论文展示了准确率高的模型在公平性、毒性上未必更好,这种权衡关系是单一榜单永远照不出来的。这份工作真正想传递的信息是:别再只问「谁最准」,要问「在什么维度上、对谁、以什么代价」。
局限与争议
HELM 自己也在论文里坦诚了边界。第一,它选的场景虽然比过去广得多,但仍然是「海量潜在场景的一个子集」,覆盖度和可行性的取舍意味着一定有没测到的地方,作者也明确标注了代表性不足的项。第二,多指标评测成本高、工程复杂,7 个指标不可能在所有场景都测(87.5% 的落地率说明仍有约八分之一的场景测不全)。第三,评测协议本身也是一种「人为选择」,提示词怎么写、few-shot 怎么设,仍可能引入偏差,HELM 是通过标准化来降低这种偏差,而不是消除它。第四,语言模型的迭代速度远超基准更新速度,任何静态榜单都会「过期」,这也是作者强调它是「living benchmark」的原因——但活基准的维护依赖社区持续投入,这点并不天然成立。
还有一个更深的争议:HELM 的多指标评测里,像「公平」「偏见」「毒性」这些维度,本身就需要做出价值判断——什么样的回答算「有毒」、什么样的差异算「不公平」,这些标准的制定就带有立场。HELM 试图用标准化协议让评测「客观」,但「客观的尺子」依然是人造的。这是所有大模型评估都无法回避的根本问题,HELM 的价值在于把这个问题显式地摆出来,而不是假装不存在。
横向对比同类工作
与同期评测工作对比,HELM 的定位很清晰:
- MMLU / GSM8K 等单任务基准:聚焦单一能力,出分快、易传播,但只能回答「某一方面强不强」。
- BIG-bench:用超大规模任务集合(200+ 任务)测模型的通用能力,广度惊人,但更偏「任务覆盖」,指标维度(校准、公平、毒性)不是重点。
- HELM:把「指标维度」和「场景覆盖」同时做厚,强调标准化协议和透明度,是「评测方法论」层面的升级,而非又一道更难的题。
可以说,MMLU 解决「考什么」,BIG-bench 解决「考多少」,HELM 解决「怎么考才客观」。
值得一提的还有一个后来崛起的「人类偏好」路线——以 LMSYS 的 Chatbot Arena 为代表的 Elo 竞技场。它不跑固定题目,而是让用户匿名对两个模型的实际回答投票,用 Elo 排名量化「哪个模型更招人喜欢」。这条路线和 HELM 形成了有趣的互补:HELM 追求「标准、可复现、多维」,Arena 追求「真实、接地气、动态」。HELM 的短板是「题目固定、可能被刷」,Arena 的短板是「偏好不等于能力、且难以控制变量」。两者合起来,才构成今天相对完整的大模型评估图景。
工程架构与「透明度」的实践意义
HELM 另一个常被低估的贡献,是它把「评测」本身做成了可复现的工程,并把「透明度」从口号变成了可操作的做法。理解这一点,对任何想自建评测体系的人都很有用。
在工程上,HELM 的关键设计是「场景适配器」:它把五花八门的评测任务,统一抽象成「给定输入 → 生成补全 → 套用指标打分」的三段式。每个场景只需要实现一个适配器,就能挂进同一个评测框架;每个新模型也只需要实现一个「生成」接口。这种模块化让「评测一个模型在 42 个场景 × 7 个指标下的表现」从「几十个独立脚本的噩梦」变成「一条流水线跑到底」,也让它天然支持「新模型随时接入、新场景随时扩展」。
在透明度上,HELM 做了一个当时很少见、后来被广为效仿的动作:公开所有模型的原始提示词、原始输出、以及评测代码。这意味着任何第三方都可以复现它的结果、检查它有没有「暗箱操作」、甚至自己加一个模型进去重跑。这对于一个充满「厂商自说自话」的领域来说,价值巨大——它把「模型评测」从「厂商的营销物料」拉回到了「可检验的科学结果」。
这两点合起来,给出了一个重要的实践启示:可信的评测,前提是「可复现」和「可审计」。如果你要对外宣称「模型 A 比 B 好」,你的评测协议应该公开到「别人照着能跑出同样的数字」的程度。否则,一个再漂亮的分数,也只是自嗨。HELM 用一整套开源工具链,把这个道理变成了现实。
HELM 的后续影响
HELM 不是一个终点,而是斯坦福 CRFM 评估体系的开端。在它之后,团队沿着同一套「标准化 + 多维度」的思路,做了一系列后续工作:
- HELM MMLU:对 MMLU 这个「行业通用考试」本身做了更严格的标准化复现,纠正了各模型在 MMLU 上「各报各分」的混乱,给出一个统一、可比的口径。
- VHELM:把评测从纯文本扩展到视觉语言模型(VLM),把 HELM 的多维评估理念带进多模态时代。
- HELM Safety / AIR-Bench 等:进一步把「安全」「风险」纳入系统化评估,回应了「大模型不仅要比能力强,更要比行为安全」的现实需求。
这些后续工作的共同点,都是「把评测这件事做得更标准、更透明、更全面」。可以说,HELM 确立的「先建分类学、再定指标、最后标准化执行」的范式,已经成为今天严肃的大模型评估(无论是学术还是工业)的默认方法论。理解了 HELM,你就理解了大模型评估这条线为什么会走到今天这个样子。
用 HELM 的方法做模型选型
HELM 给实际工作最大的启发,是它用数据击穿了「找一个最强模型」的幻想。论文的 25 条顶层发现里,有一条被反复引用:没有任何一个模型能在所有指标、所有场景上全面领先。一个在准确率榜单上登顶的模型,可能在校准度上垫底;一个毒性控制得很好的模型,推理效率可能很差。所以「选模型」不是一个「挑分数最高」的问题,而是一个「先明确自己要什么、再匹配对应指标、最后接受权衡」的过程。
具体到操作,可以借鉴 HELM 的三步。第一步,先把你真正关心的场景和指标列出来——是客服场景更看重毒性控制,还是代码场景更看重准确率;第二步,只在这些场景和指标上做横向对比,而不是被一个综合分数牵着走;第三步,把「校准度」纳入必看项,因为一个「迷之自信」的模型,在需要人来决策的场景里比「答错」更危险。这套「场景 + 指标 + 校准」的选型视角,正是 HELM 把「评测」从「排名」还原成「诊断」的核心贡献。
总结与启示
HELM 给行业最大的启示是:单一指标会撒谎,全景评测才能逼近真相。对于做模型选型、做安全合规、做对外宣传的团队,这条尤其重要——你不能只拿一个准确率分数就对模型下结论,校准度、鲁棒性、公平性、毒性、效率每一项都可能在实际落地时反咬一口。对于做评测的人,HELM 提供了一个可复用的工程范式:先建分类学、再定指标协议、最后标准化执行并开源全部原始数据。
落到实践层面,有几点可以直接拿走:其一,选模型时至少同时看「准确率 + 校准度 + 效率」三个维度,避免被单一榜单误导;其二,对外宣称「模型更优」时,务必说清「在什么场景、什么指标、什么条件下更优」,否则结论站不住;其三,自建评测时,优先保证「标准化」和「可复现」,把 prompt、few-shot、随机种子都固定下来,这是评测可信度的地基。这套「透明评测」的理念,后来直接影响了斯坦福后续的 HELM MMLU、VHELM 等工作,也成为业界「多维度评测」的默认参照系。


