
数据集速览
| 数据集名称 | GSM8K(Grade School Math 8K) |
| 发布机构 | OpenAI(作者 Karl Cobbe、Vineet Kosaraju、Mark Chen 等) |
| 发布时间 | 2021 年 10 月(论文《Training Verifiers to Solve Math Word Problems》) |
| 数据规模 | 8500 道小学数学文字题 |
| 语言 | 英文 |
| 许可证 | MIT(GitHub:github.com/openai/grade-school-math) |
| 一句话定位 | 用来诊断大模型多步数学推理能力的经典文字题基准 |
它到底在测什么
GSM8K 的全称是 Grade School Math 8K,直译过来就是”小学数学 8 千题”。题目本身是小学级别的应用题,涉及加减乘除等基础运算,单看难度并不高——一个成年人通常能轻松做对。但正是这种”对人类简单”的属性,让它在评估大模型时变得特别有信息量:如果连概念上如此简单的多步推理都做不稳,那模型在更复杂的推理任务上就更靠不住了。
论文开篇就点出了动机:当时最先进的语言模型虽然能在很多任务上匹敌人类,但在多步数学推理上仍然表现挣扎。GSM8K 的定位,就是提供一个干净、可复现的”诊断工具”,专门用来暴露模型在这类推理上的失败模式。
数据构成与质量
GSM8K 包含 8500 道高质量的、语言表述多样的数学文字题,全部由人工编写。这些题目被划分为训练集和测试集,测试集用于评估模型的解题准确率。题目的一大特点是语言多样:同一个数学结构会被包装成不同场景、不同措辞的题目,从而考察模型是否真正理解了题意,而不是靠记忆或模板匹配蒙混过关。
每一道题都附带详细的解题步骤和最终答案,这使得它既可以做最终答案的准确性评估,也可以用来检验模型中间推理过程的正确性。
它催生了「验证器」路线
GSM8K 论文更大的贡献,可能在于它提出的解决方案。论文发现,仅仅把模型做大并不能稳定提升数学题的正确率。于是团队提出了”验证器”(verifier)的思路:训练一个额外的模型,专门判断某个候选答案是否正确;在推理时,先让模型生成多个候选解,再用验证器挑出排名最高的那个。实验证明,验证机制能显著提升 GSM8K 上的表现,而且验证器的效果随着数据量增加而扩展得比单纯微调更好。
这个”生成多个候选 + 验证器选优”的思路,与后来大热的”思维链 + 自我一致性”、以及推理时采样的技术演进一脉相承。GSM8K 因此不只是一个测试集,它还成了一个技术路线的发源地。
GSM8K 与思维链:一对黄金搭档
GSM8K 之所以在推理研究里地位特殊,很大程度上是因为它和「思维链」(Chain-of-Thought,CoT)技术的绑定。2022 年,Wei 等人的工作发现:只要在提示里让模型「一步一步地思考」,而不是直接要答案,模型在 GSM8K 这类多步数学题上的准确率就会大幅跃升。这个发现在当时极具冲击力,因为它揭示了一个反直觉的事实——模型的推理能力其实一直在,只是需要正确的「打开方式」。
GSM8K 恰好是验证这类技术最理想的实验场:题目足够多步、足够需要推理,又有明确的数值答案可以客观判对错。于是,CoT、自我一致性(Self-Consistency,采样多个推理路径再投票)、以及后来的各种推理增强方法,几乎都把 GSM8K 当作第一块试金石。一个数据集能和一项核心技术如此深度绑定、互相成就,在领域里并不多见。
评估实操:准确率是怎么算出来的
用 GSM8K 评测模型,通常遵循一套相对标准的流程。模型针对每道题生成答案(往往包含推理步骤和最终数值),评估时从输出中提取出最终答案,与标准答案做精确匹配——数字完全一致才算正确,任何计算错误都会判错。这种严格匹配保证了评估的客观性,也意味着模型一旦在中间步骤算错,哪怕思路正确也会丢分。
在实际操作中,还会区分「贪婪解码」和「多数投票」两种口径:前者让模型一次生成一个答案,后者采样多个候选再投票取众数。很多论文会同时报告这两个数字,因为多数投票能显著提升准确率,但也会带来更高的推理成本。理解了这套评估逻辑,再看各模型报告的 GSM8K 分数,才能知道它们各自在什么条件下测出来的。
为什么它经久不衰
一个 2021 年的小学数学题数据集,为什么到 2026 年仍然是大模型论文里的标配评测项?原因有几点。第一,它门槛低、可复现性强,任何团队都能低成本地跑通。第二,它足够”干净”,人工编写保证了质量和答案的正确性,几乎没有标注噪声。第三,它稳定地暴露模型短板——即使是最新的大模型,在 GSM8K 上也不一定能拿满分,它依然能区分出模型之间的推理差距。第四,它有清晰的数值答案,评估是客观的,不存在主观评分争议。
正因如此,GSM8K 成了思维链(Chain-of-Thought)研究、推理增强、模型蒸馏等工作的标准参照系之一。很多中文模型也会用它或它的中文变体来汇报推理能力。
下载与使用
GSM8K 的数据公开在 GitHub 仓库 openai/grade-school-math,采用 MIT 许可证,可直接商用。数据格式为 JSON,包含题目、解题步骤和最终答案。在 Hugging Face 上也有多个镜像版本,方便用 datasets 库直接加载。评估时通常采用”最终答案匹配”的方式判定对错,也可以额外评估中间推理步骤的质量。
数据污染:一个绕不开的新问题
随着 GSM8K 的名气越来越大,一个棘手的问题也随之而来:数据污染。所谓污染,指的是模型的训练语料里已经混入了 GSM8K 的题目和答案——这在大规模网页抓取的预训练数据中几乎无法完全避免,因为 GSM8K 的题目早已被无数博客、论文、代码仓库转载。
一旦模型「见过」考题,它的 GSM8K 分数就失去了纯粹的衡量意义:高分可能反映的是记忆而非推理能力。这个问题并非 GSM8K 独有,但因为它公开早、引用广,污染风险尤其高。研究者们因此发展出各种检测和应对手段,比如在评测时改用未公开的题目变体、或者报告模型训练数据的去污染情况。这也提醒我们:任何公开已久的基准,分数都应当带着「是否可能被污染」的审慎去看,单独一个数字很难说明全部问题。
横向对比同类数学基准
在数学评测这条线上,GSM8K 旁边还有几个常被一起提及的名字。MATH 数据集(同样是 OpenAI 推出)收录了 12500 道竞赛级数学题,难度明显更高;HumanEval 和 MBPP 则转向代码生成评测。GSM8K 的独特定位在于”低难度但高诊断价值”——它把焦点放在多步推理本身,而不是数学知识的深浅,这让它和其他数学基准形成了互补。很多评测会同时报告 GSM8K(基础推理)和 MATH(高阶数学)两项,以全面刻画模型的数学能力。
局限与注意事项
GSM8K 的局限也要说清楚。第一,题目是小学数学级别,天花板有限,随着模型能力提升,它已经出现”接近饱和”的趋势,难以区分顶尖模型。第二,它只有英文,评测中文模型或多语言能力时存在语言偏差。第三,它只测数值答案的正确性,不直接考察证明、公式推导等更深的数学能力。第四,由于数据集公开已久,存在训练数据污染的风险——部分模型可能在训练时”见过”这些题,导致分数虚高。因此,如今单独看 GSM8K 分数意义有限,通常需要结合 MATH、MMLU 等多个基准交叉判断。
参考来源
论文《Training Verifiers to Solve Math Word Problems》(arXiv:2110.14168);GitHub 仓库 openai/grade-school-math。


