
综合榜上的第一名可能只有一个,但专项能力榜上,「第一名」有五个、十个甚至更多——因为没有一个模型能在所有专项上都称王。2026 年的现实是:写代码最强的是 Anthropic,做数学竞赛最强的是 OpenAI,啃博士级科学题最强的是 Sakana AI,跑实时编程评测最强的却是 DeepSeek。同一批模型,换一个专项榜单,名次就天翻地覆。
这正是专项能力榜的价值所在:它不像综合榜那样把一堆能力搅成一个平均分,而是把「代码」「数学」「推理」「科学」「多模态」拆开,让你看清每个模型真正的杀手锏和致命伤。这篇横向对比,就带你逐个拆解 2026 年五大专项赛道的第一梯队,以及每个「第一」背后藏着的争议。
一、速览卡:2026 五大专项榜首一览
| 专项赛道 | 代表基准 | 当前第一(分数) | 值得关注的第二名 |
| 代码生成 | SWE-bench Verified | Claude Fable 5(95%) | Claude Opus 4.8(88.6%) |
| 实时编程 | LiveCodeBench | DeepSeek V4 Pro(93.5%) | Sakana Fugu Ultra(93.2%) |
| 数学竞赛 | AIME 2025 | Claude Sonnet 4.6(95.6%) | GPT-5(94.6%) |
| 博士科学 | GPQA Diamond | Sakana Fugu Ultra(95.5%) | Claude Opus 4.8 / GPT-5.5(93.6%) |
| 多模态理解 | MMMU | GPT-5(84.2%) | o3(82.9%) |
| 研究级数学 | FrontierMath T1-3 | GPT-5.5 Pro(87.7%) | Claude Fable 5(87.0%) |
二、为什么专项榜比综合榜更「有用」
选模型这件事,几乎没有人是真的「需要一个全能的模型」。工程师选模型,是为了写代码;研究员选模型,是为了啃论文里的数学;产品经理选模型,是为了让它看懂一张复杂的图表。而综合榜的最大问题恰恰是——它用一个平均分把这些截然不同的需求糊在了一起。
一个典型的例子:Artificial Analysis 的 Intelligence Index 里,智能体(Agents)一项就占 34% 的权重,代码只占 24%。这意味着一个靠「专业知识工作和银行智能体任务」登顶的模型,未必是写代码最强的那个。只看综合分,你会错过「DeepSeek V4 Pro 在 LiveCodeBench 上 93.5% 登顶」这种真正对你有用的信息。
所以专项榜的正确用法是:先想清楚你的任务属于哪条赛道,再看那条赛道的专项榜,最后用综合榜做交叉验证。这一篇按赛道逐个来。
三、代码赛道:SWE-bench 与 LiveCodeBench 的「两个第一」
3.1 SWE-bench Verified:修复真实 GitHub issue
SWE-bench 是现在最受认可的「真实编程」基准之一。它从真实的 GitHub issue 里取 500 道题(Verified 子集经过人工标注),要求模型读懂一个 Python 仓库、定位需要修改的文件、生成一个能通过单元测试的补丁。这不是「写一段算法」的玩具题,而是接近真实工程师日常的「修 bug」工作。
2026 年 8 月的榜首是 Claude Fable 5,SWE-bench Verified 95%,其后是 Claude Opus 4.8(88.6%)、DeepSeek V4 Pro(80.6%)、Claude Sonnet 4.6(79.6%)。Anthropic 在 SWE-bench 这条赛道上形成了断层式领先——前两名都是它的模型,而 Fable 5 的 95% 也刷新了这条基准的历史记录。值得一提的是,DeepSeek V4 Pro 以开源之身拿到 80.6% 杀进前三,是开源模型在真实代码修复上的一个重要突破。
3.2 LiveCodeBench:防污染的实时编程
但换到 LiveCodeBench,第一名就换了人。LiveCodeBench 是一个「防污染」的编程基准——它持续从 LeetCode、AtCoder、Codeforces 等竞赛平台收集新题,并标注发布时间,只评测「模型训练截止日期之后才出现」的题目。这意味着模型没法靠「背题」拿分,考的是真实的代码生成能力。
在这条更「硬」的赛道上,DeepSeek V4 Pro 以 93.5% 登顶,Sakana Fugu Ultra 以 93.2% 紧随其后,DeepSeek V4 Flash 91.6% 排在第三。这里出现了一个很有意思的现象:SWE-bench 的王者 Claude 反而在 LiveCodeBench 前十名之外。两条都是「编程」基准,结论却几乎相反——这恰恰说明,「修 bug」和「竞赛刷题」是两种不同的代码能力,一个模型可以极擅长前者、却不擅长后者。
3.3 代码赛道的结论
把两条基准合起来看,2026 年代码能力的真实格局是:真实工程修复(SWE-bench)Anthropic 断层领先,实时竞赛编程(LiveCodeBench)DeepSeek 登顶。而 felloai 的月度横评又补充了第三个视角——在 LMArena 的 WebDev 投票榜上,Kimi K3 以 1682 分领跑,靠的是「人投票觉得它做的网页最好」。三个榜单、三个第一名,谁更该信,取决于你到底要「修 bug」「刷题」还是「做网页」。
四、数学赛道:AIME 与 FrontierMath 的两个难度档
4.1 AIME 2025:竞赛数学的「基础卷」
AIME(美国数学邀请赛)是高中数学竞赛里公认的硬骨头,也是大模型数学能力的常用标尺。2026 年的 AIME 2025 榜首是 Claude Sonnet 4.6,95.6%,GPT-5 以 94.6% 紧随其后,Grok 3 93.3%、o4-mini 92.7% 分列三四。值得注意的是,登顶的不是各家最贵的旗舰,而是 Anthropic 的「中杯」Sonnet 4.6——这在数学赛道并不罕见,因为竞赛数学考的是推理路径的稳定性,而不是参数规模。
4.2 FrontierMath:研究级的「地狱卷」
如果 AIME 是「基础卷」,那 FrontierMath 就是「地狱卷」。这是 Epoch AI 维护的一组未公开的、由专家编写的数学题,覆盖从高年级本科到早期研究级的难度,模型无法背题。2026 年 6 月发布的 v2 版本里,Tier 1-3(较易三档)的榜首是 GPT-5.5 Pro,87.7%,Claude Fable 5 以 87.0% 紧随其后;而最难的研究级 Tier 4,榜首变成了 Claude Fable 5,87.8%,GPT-5.5 Pro 掉到 78.0%。
这里有个值得玩味的反转:题目越难,领先者越不确定。GPT-5.5 Pro 在「较难但尚可解」的题目上更强,而 Claude Fable 5 在「研究级」的终极难题上反超。这再次印证了专项榜的一个核心规律——不同难度档位,第一名可能完全不同。
五、科学推理赛道:GPQA Diamond 的「博士生考试」
GPQA Diamond 是一组 198 道博士级的生物、化学、物理选择题,它的「Diamond」子集只保留那些「领域专家答对、非专家却答错」的题,随机猜的得分仅约 25%,是衡量「模型到底懂不懂硬科学」的黄金标准。
2026 年的榜首是一个相对冷门的名字——Sakana AI 的 Fugu Ultra,以 95.5% 登顶 GPQA Diamond,压过了 Claude Opus 4.8(93.6%)和 GPT-5.5(93.6%)。这个结果本身就很有信息量:一家规模远小于 Anthropic、OpenAI 的日本实验室,能在「博士科学」这条硬核赛道上登顶,说明科学推理这个能力的竞争格局,远没有综合榜看起来那么稳固。
不过要提醒的是,GPQA Diamond 正在「饱和」。Artificial Analysis 已经在 2026 年 9 月的 v4.2 里把它退役了,理由是前沿模型普遍做对、不再能区分彼此。所以这条赛道的第一名,含金量正在被它自己的「太简单」所稀释。
六、多模态与智能体赛道:GPT 与 Gemini 的地盘
多模态理解(MMMU,考察图文综合理解)这条赛道上,GPT-5 以 84.2% 居首,o3(82.9%)、Gemini 2.5 Pro(81.7%)、o4-mini(81.6%)紧随其后。OpenAI 在多模态理解上保持着微弱但稳定的领先。这条基准考察的是模型「看图 + 读文字 + 综合推理」的能力,比如给一张医学影像配一段说明,让模型判断诊断方向;或者给一份带图表的财报,让它提取关键结论。对做文档分析、电商图文、医疗辅助的人来说,MMMU 比代码或数学基准更有参考价值。
而「智能体(Agent)」这个 2026 年最热的赛道,独立评测给出的答案又不一样。在 METR Time Horizons(衡量模型能独立完成多久时长的真人任务、以 50% 成功率为界)上,Claude Mythos Preview 以 1044.8 分钟居首,几乎是第二名 Claude Opus 4.6(718.8 分钟)的 1.5 倍。这条基准的价值在于,它不问你「会不会答一道题」,而是问你「能扛住多长的连续工作」——这对 2026 年越来越火热的智能体应用,才是最关键的指标。
智能体赛道的另一条热门基准是 Terminal-Bench,它让模型在真实的终端环境里自主完成「编译代码、训练模型、搭服务器、系统管理、安全任务」这类端到端的操作,考察的是模型的「工具使用 + 多步规划」能力。2026 年 8 月这条基准上的一个焦点是 Grok 4.6——它在 Terminal-Bench v2.1 上达到 88.4%,并且以约为 Opus 5 一半的轮次完成长时智能体任务,成为「性价比智能体」的黑马。智能体赛道之所以值得单独盯,是因为它测的是「模型能不能真的替你干活」,而不是「会不会答题」,这更接近未来 AI 应用的真实形态。
七、专项榜怎么读:几个关键技巧
专项榜虽然比综合榜「有用」,但它也有读法上的讲究。这里给几条实战技巧。
第一,同一赛道要多看几条基准、交叉验证。代码能力看 SWE-bench 和 LiveCodeBench 会得出相反的结论,只有把两条都看了,你才知道一个模型到底是「工程修复强」还是「竞赛刷题强」。只看一条,等于只看到了一半真相。
第二,分清「厂商自报」和「独立评测」。Meta 的 Muse Spark 1.3 在自家图表上编码「全胜」,但那些是仅合作伙伴可调用的 max 变体数字,通用版在独立评测上只有 61 分。LMCouncil 这类聚合站的价值,就在于它只收独立机构(Epoch、Scale)的数据,帮你把「厂商自报」这一层噪音滤掉。
第三,关注基准的「饱和」信号。当一个专项基准的榜首分数接近天花板、且前几名挤在一起分不开时(GPQA Diamond 就是典型),说明这条基准已经快「不够用了」,它的排名区分度在下降。这时候与其纠结 93.6% 和 93.4% 谁高,不如去看下一个更难、更新的基准。
第四,把「难度档」和「版本」也考虑进去。FrontierMath 的 Tier 1-3 和 Tier 4,第一分别是 GPT-5.5 Pro 和 Claude Fable 5;AIME 的 2025 版和更早版本,榜首也不同。引用一个「第一」之前,先确认它对应的是哪个难度、哪个版本、哪个脚手架。
八、横向对比:谁是真正的「专项之王」
把所有专项榜放在一张表里看,一个清晰的格局浮现出来:
| 赛道 | 王者(机构) | 一句话点评 |
| 真实代码修复 | Claude Fable 5(Anthropic) | SWE-bench 断层第一,工程修复无出其右 |
| 实时竞赛编程 | DeepSeek V4 Pro(DeepSeek) | 防污染基准登顶,开源之光 |
| 竞赛数学 | Claude Sonnet 4.6(Anthropic) | 「中杯」反超旗舰,性价比惊人 |
| 研究级数学 | GPT-5.5 Pro / Claude Fable 5(OpenAI/Anthropic) | 难度越高,冠军越不稳 |
| 博士科学 | Sakana Fugu Ultra(Sakana AI) | 小厂逆袭,但基准已趋饱和 |
| 多模态理解 | GPT-5(OpenAI) | 微弱但稳定领先 |
| 长时智能体 | Claude Mythos Preview(Anthropic) | 耐力第一,Agent 时代的关键指标 |
结论非常清楚:Anthropic 是「工程与耐力」的王者,DeepSeek 是「实时编程与开源」的王者,OpenAI 是「数学与多模态」的均衡强者,而 Sakana 这样的小厂也能在单点上完成逆袭。没有一个模型能通吃所有专项,这正是专项榜存在的意义。
九、局限与争议:专项第一的「水分」从哪来
专项榜同样有它的坑,这里如实列出。
第一,厂商自报 vs 独立评测的落差。最典型的例子是 Meta 的 Muse Spark 1.3——它在 Meta 自己发布的图表上「三项编码全胜」,但那些数字是「仅合作伙伴可调用的 max 变体」的,通用版在独立评测的 Intelligence Index 上只有 61 分(对 Opus 5 的 63),且 Arena 尚未给它投票。任何「厂商自报第一」都要打一个问号,独立评测(如 LMCouncil 汇总的 Epoch、Scale 等机构数据)才是更可信的参照。
第二,饱和与污染。GPQA Diamond 已经饱和到被退役,而任何公开基准都有被「背题」的风险。专项榜的分数,永远要结合「这个基准是不是已经不够用了」来判断。
第三,版本与脚手架敏感。同一个模型,换一套 prompt 策略(scaffolding),在 AIME 或 FrontierMath 上的分数能差出一大截。很多「第一」其实是「某套脚手架下的第一」,脱离那个条件就不成立。
十、总结:按你的任务,选对的专项王者
专项能力榜给我们的最终启示,其实是一句大白话:别问「谁是最强模型」,要问「谁最强地做我这件事」。
如果你的工作是写代码、修 bug、做真实工程,Anthropic 的 Claude 系列是当前最稳的选择;如果你要跑实时竞赛编程、又要开源可控,DeepSeek V4 Pro 是性价比和能力的双重惊喜;如果你啃的是数学和科学研究,OpenAI 的 GPT-5.5 Pro 和 Claude Fable 5 在难题上互有胜负,值得各自试一遍;而如果你开始做智能体、关注模型的「长时耐力」,那 METR 时间线这条新基准,比任何传统分数都更值得你盯紧。
专项榜的价值,正在于它逼你把「选模型」这件事,从「看一个数字」还原成「想清楚一个任务」。想清楚了,第一是谁,你自己心里就有数了。
参考来源
- AY Automate《LLM Leaderboard 2026: Benchmarks, Speed & Price》(SWE-bench / AIME / GPQA / LiveCodeBench / MMMU 榜首)
- LMCouncil / AI Explained《AI Model Benchmarks Jul 2026》(HLE / GPQA / FrontierMath / METR)
- CompareLLM 持续实测榜单(comparellm.ai)
- Fello AI《Best AI Models in 2026》及《When to Use Which AI》(WebDev / 编码王者分析)
- Artificial Analysis Intelligence Index 方法论(v4.1 / v4.2)
- LLM Stats 基准页(SWE-bench Verified / LiveCodeBench / GPQA 分榜)


