2026 大模型综合实力榜:LMArena 和 Artificial Analysis,到底谁说了算?

2026 大模型综合实力榜:LMArena 和 Artificial Analysis,到底谁说了算?

如果你在 2026 年问「现在最强的通用大模型是谁」,得到的答案会因你打开哪个榜单而完全不同。打开 LMArena(原 Chatbot Arena),榜首是 Anthropic 的 Claude Fable 5,Arena Elo 1507;打开 Artificial Analysis 的 Intelligence Index,9 月 1 日发布的 Claude Fable 5.1 又反超了自己的上一代;再翻静态基准榜单,Humanity’s Last Exam 的第一却是 Gemini 3.1 Pro Preview。三个「权威榜单」,三个第一名。

这并非谁在造假,而是三者衡量的是完全不同的东西。这篇横向对比,就带你把这三大综合榜单的底层机制彻底拆开——它们各自怎么打分、奖励什么、藏着什么盲区,以及当你真正要选一个模型去用的时候,该怎么读懂一个综合分数背后的真实含义。

一、速览卡:2026 三大综合榜单横向对比

对比维度LMArena(原 Chatbot Arena)Artificial Analysis Intelligence Index静态基准(HLE/GPQA/MMLU-Pro)
打分机制盲测 A/B 投票 → Elo 评分机构自跑 9~10 项标准化评测 → 加权指数固定题目集 → 精确匹配/选择题得分
测的是什么人类「更喜欢」谁的回答任务完成能力(pass@1)固定题目上的准确率
当前第一Claude Fable 5(Elo 1507)Claude Fable 5.1(Index 66)Gemini 3.1 Pro Preview(HLE 46.4%)
样本/规模770 万+ 票、389 个模型内部数据集、95% 置信区间 <1 分HLE 2500 题、GPQA Diamond 198 题
最大盲区偏好≠能力,风格可压实质纯文本、纯英文,无人类偏好信号饱和、数据污染、刷分
一句话定位「大家爱用谁」「谁的任务能力更强」「谁背题背得牢」

二、为什么一个综合排名值得你认真看

综合能力榜是大模型行业里最被引用、也最容易被误读的一类数据。几乎所有模型发布,厂商都会在技术报告里放一个「综合分数」;所有选型决策,工程师第一步往往也是「看排名」。但大多数人不知道的是,这些「综合分数」背后是完全不同的机器在运转,它们奖励的东西南辕北辙,把它们放在一起比较,就像把百米成绩和跳高成绩相加一样荒谬。

具体到 2026 年,一个数字能说明问题的严重性。Artificial Analysis 官方自己承认:Claude Opus 5 以 61 分领先 Fable 5 的 60 分,这个 1 分之差恰好落在其 95% 置信区间的边缘——它是真实的、是持续测量的,但它绝不是一道鸿沟。任何把 1 分的 Intelligence Index 领先描述成「碾压」的报道,都没读过它的方法论。反过来,LMArena 上一段 100 分的 Elo 差距,意味着高分模型在正面对决中约有 64% 的胜率;200 分则约 76%。25 分以内的波动基本是噪声。

所以读综合榜单的第一课是:先搞清楚它测的是什么,再决定信它多少。这一篇要做的,就是把三个最主流的综合榜单的机制摊开来讲清楚。

三、LMArena:770 万次盲选投出来的「人气榜」

3.1 机制:盲测投票与 Elo 评分

LMArena 的机制其实非常朴素。你输入一个 prompt,系统会匿名地让两个模型各答一遍,你选出更喜欢的那一个,在揭晓身份之前完成投票。数百万次这样的两两对决被汇总,用 Bradley-Terry 模型(一种配对比较的统计模型,重标定后看起来像国际象棋的 Elo 分)算出每个模型的评分。这个项目 2023 年从 UC Berkeley 的 LMSys 出发,2024–2025 年更名为 LMArena,2026 年 1 月又进一步简称为 Arena。

它的规模相当惊人:文本榜一个就积累了超过 770 万票、覆盖 389 个模型,另外还有智能体(Agent)、Web 开发、视觉、图像生成、搜索等多个独立分榜。这也是它最大的价值——它回答了一个任何客观评测都回答不了的问题:真人到底更愿意用哪个模型

3.2 2026 年的榜单格局

按 2026 年 8–9 月的快照,文本榜前十大致是这样的格局:Anthropic 的 Claude Fable 5 以 Arena Elo 1507 居首,其后是 Claude Opus 5(1522)、GPT-5.6 Sol(1514)、GPT-5.5(1506)、Kimi K3(1500)、Claude Opus 4.8(1512)、Gemini 3.1 Pro(1505)等。值得注意的一个结构变化是:文本榜上已经有三款模型突破了 1500 这个历史性的 Elo 门槛,而开源模型梯队已经逼近闭源前沿——Moonshot 的 Kimi K3 以开源之身杀进了第一梯队,是少数能在这个纯人气榜上和闭源旗舰掰手腕的开源选手。

一个细节是,LMArena 的排名在实时微调。同一批模型在不同日期的快照里 Elo 会有几分的浮动,这是配对比较系统固有的噪声,不是模型的真实涨跌。

3.3 它最大的软肋:偏好≠能力,且能「刷」

LMArena 被批评最多的一点,是人类偏好和真实能力之间有条裂缝。投票者往往会奖励「自信的格式」——排版工整、语气笃定的回答——哪怕内容并不更准确。这正是榜单后来加了一个「风格控制开关」(style-control toggle)的原因,试图把「好不好看」和「对不对」分开。

更值得警惕的是它的「刷榜」历史。2025 年 4 月,Cohere Labs 和高校合作者发表了一篇题为《The Leaderboard Illusion》的论文,指出 Meta 曾在发布前用 27 个私有 Llama 4 变体在 Arena 上测试、并有选择地披露结果,同时闭源模型被抽样进入对决的次数显著多于开源模型。Arena 官方随后回应,称发布前测试对任何实验室都开放,并质疑了该论文的框架。两份文档都值得一读——在把一次 Arena 排名当作金科玉律之前,你要知道它既测偏好、也可被操纵

四、Artificial Analysis:最接近「独立测量实验室」的综合指数

4.1 机制:自己跑、pass@1、加权

如果说 LMArena 是「人气票选」,那 Artificial Analysis 的 Intelligence Index 就是最接近「独立测量实验室」的东西。它的核心是机构自己运行每一轮评测,用的是内部持有的数据集副本,而不是厂商自报的数字,所有模型统一设定、统一 pass@1 评分(模型第一次尝试就必须答对,没有 best-of-N 的刷分空间),并且给整个指数估出了 95% 置信区间、误差小于 1 分。这让分数在厂商之间真正可比——这在整个行业里几乎是独一无二的。

版本 v4.1 的组合是九项评测、四大类加权:智能体工作占 34%(其中 GDPval-AA v2 单项就占 20%)、编程 24%、科学推理 24%、通用能力 18%。到了 2026 年 9 月 4 日发布的 v4.2,结构又做了大改:私有/未公开测试集的权重翻倍到 40%,新增了 AA-Briefcase(多周知识工作、上千份源文件的智能体评测,单项权重 15%)和 GDP.pdf(Surge AI 做的长文档推理),同时把 GPQA Diamond 退役了——因为它「饱和」了,前沿模型已经普遍做对,不再能区分彼此。

4.2 榜单格局与一个反直觉的结果

v4.2 的综合榜首是 Claude Fable 5.1(Index 66),其后是 GPT-6 Astra(相对 GPT-5.6 Sol 涨了 4 分)、Claude Opus 5(63)、GPT-5.6 Sol(61)。但最反直觉的是:一个模型可以凭借智能体能力登顶,却未必是最强的纯代码生成器——因为代码只是那个 24% 切片里的一部分。Claude Opus 5 在发布时 Intelligence 61、Coding 78、Agentic 55 三张分榜读数截然不同,就是最好的例子。

它的诚实局限也写得很明白:这套评测是纯文本、纯英文的,而且一个测量出来的指数,丝毫不能告诉你人类到底喜不喜欢这个模型的回答。这也是为什么它和 LMArena 常常「打架」——一个测任务能力,一个测偏好,本来就该有分歧。

五、静态基准:HLE、GPQA、MMLU-Pro 的另一面

第三类综合榜单是静态基准套件,比如 Humanity’s Last Exam(HLE)、GPQA Diamond、MMLU-Pro。它们用固定题目集、精确匹配或选择题打分。HLE 是其中最「硬」的一个——由近千名专家出题、2500 道极难的跨学科题目,当前第一名是 Gemini 3.1 Pro Preview(46.4%),紧随其后的是 GPT-5.4 Pro(44.3%)和 Meta 的 Muse Spark(40.6%)。

静态基准的优点是好复现、好对比,但它的三个通病也越来越明显:饱和(大家都快满分了,分数失去区分度,GPQA Diamond 正是因此被 AA 退役)、污染(题目泄漏进预训练数据,分数虚高)、以及对脚手架(scaffolding)敏感(同一模型换套 prompt 策略分数能差很多)。这也是为什么独立评测机构越来越多地把它们和私有测试集、动态评测混用。

六、关键数据逐字保留:几个你必须记住的数字

下面这些数字来自上文引用的各榜单官方与独立机构的公开数据,逐字保留,供你直接引用比对:

  • LMArena 文本榜累计 770 万+ 票、389 个模型;Claude Fable 5 Arena Elo 1507100 Elo 差距 ≈ 64% 胜率,200 Elo ≈ 76%,25 分以内是噪声
  • Artificial Analysis Intelligence Index v4.2:Claude Fable 5.1 66 分居首,GPT-6 Astra 次之;v4.1 时代 Opus 5 61 vs Fable 5 601 分之差在置信区间边缘
  • GDPval-AA v2 的 Elo 锚点:人类专家 = 1000,Claude Opus 5 约 1861,归一化后约 0.68。
  • HLE 榜首 Gemini 3.1 Pro Preview 46.4% ±2.0;GPQA Diamond 榜首 GPT-5.4 Pro 94.6% ±1.6
  • DeepSeek V4 Flash 0731 在 AA v4.1 得 50 分,反超自家 V4 Pro (max) 的 44 分。

七、深入一个数字:Elo 到底怎么算出来的

既然两个主流综合榜都绕不开 Elo,这里花一点篇幅把这个「神秘数字」讲透,因为它直接决定了你该怎么读榜单。

Elo 最初是 1960 年代为国际象棋发明的相对评分系统:两个棋手对弈,赢家从输家手里拿走分数,击败一个高分对手比击败一个低分对手拿到的分更多。它没有「绝对质量」,只有一个随胜负关系浮动的相对数字。应用到 AI 评测上,Arena 把「棋手」换成了「模型」,把「对弈」换成了「同一个 prompt 下两个匿名模型的回答,由真人投票定胜负」。这一票,会同时向上或向下微调两个模型的评分。

但要注意,Arena 底层用的其实不是原始的 1960 年代 Elo 公式,而是Bradley-Terry 最大似然估计——一种相关但不同的配对比较统计模型,算完之后再重新标定,让数字看起来、用起来都像 Elo。这个技术细节很重要,因为它意味着「Elo 分」在 AI 榜单里是一个被「翻译」过的量,跨榜单的 Elo(比如 Arena 的 1507 和 GDPval 的 1861)根本不在同一个尺度上,绝不能直接比较

理解了这一点,前面那张速览卡里的数字你就不会误读了:Claude Fable 5 的 Arena Elo 1507,和 GDPval-AA v2 上 Opus 5 的 1861 Elo,是两套完全不同的锚点(前者锚在「文本偏好对战」,后者锚在「人类专家 = 1000」)。把它们放在一起比大小,是外行才会犯的错误。

八、横向对比:三张榜单为何总是不一致

把三张榜单放在一起,你几乎总能找到「同一个模型三处不同名次」的情况。这不是 bug,而是方法论差异的必然结果。用一个表格把它们的本质区别钉死:

问题LMArenaArtificial Analysis静态基准
「模型 A 比 B 强」意味着真人更喜欢 A 的回答A 在统一任务上 pass@1 更高A 在固定题目上答对更多
会被什么「骗」自信的语气、好看的排版英文/文本外的能力测不到背题、数据污染、饱和
什么时候该信它选「用起来舒服」的产品选「任务完成率」的工程快速横向扫一眼、找明显短板

结论很朴素:信它们的交集。当三张榜单都说一个模型强,那它大概率是真的强;当它们各执一词,那个「分歧点」本身往往才是最有价值的信息——它告诉你这个模型的长板和短板分别在哪儿。

九、局限与争议:综合榜能不能「刷」、该不该信

综合榜的争议从来不少,这里如实列出几条最值得警惕的。

第一,刷榜与选择性披露。《The Leaderboard Illusion》那篇论文已经把 Arena 上的操作空间讲清楚了,而厂商在技术报告里「选择性报对自己有利的基准」更是行业公开的秘密。综合榜一旦成为营销工具,中立性就打折。

第二,版本漂移让「历史第一」变得廉价。Intelligence Index 从 v4 到 v4.1 再到 v4.2,权重和题目一年内变了好几次。同一个模型在不同版本下的分数不可直接跨版本比较,而很多报道根本不标注版本号,这是数据污染的一个隐蔽来源。

第三,综合分的「平均主义」会掩盖偏科。一个「综合 61 分」的模型,可能在代码上 78 分、在某个冷门科目上只有 30 分。只看总分,你既看不到它的杀手锏,也看不到它的致命伤。

第四,中文与多模态的盲区。AA 自己承认只测纯文本纯英文,LMArena 的投票者又高度集中在英语开发者社区。对中文场景、对多模态场景,这些综合榜的参考价值要打一个问号,这也是国内选型时尤其要注意的。

十、总结:怎么真正读懂一个综合分数

回到开头的那个问题——2026 年谁是最强通用模型?诚实的答案是:取决于你问的是「能力」还是「人气」,也取决于你要拿它干什么

如果只让我给三条可操作的建议,我会这么说:第一,永远先问「这个分数是哪个榜单、哪个版本给的」,跨版本、跨榜单的数字直接相加是错的;第二,综合分只做初筛,最终选型看专项分榜和真实任务——你要写代码,就看 Coding/WebDev 分榜和 SWE-bench,而不是那个笼统的综合指数;第三,把价格、速度、托管方式这些「分数之外的数」一起算进去,一个便宜一半、速度翻倍但综合分低 1 分的模型,在真实工程里常常是更优解。

综合榜是一把有用的尺,但它量的是「别人觉得谁好」,而不是「谁对你最好」。读懂它的机制,你才能不被一个数字牵着走。

参考来源

  • LMArena / Arena 官方榜单与机制说明(lmarena.ai)
  • Artificial Analysis Intelligence Index v4.1 / v4.2 方法论与榜单(artificialanalysis.ai)
  • Opper AI《LLM rankings in 2026: how leaderboards work and which to trust》
  • ExplainX《AA Intelligence Index v4.2: Fable 5.1 Leads》
  • The Vibefather《What Is the Artificial Analysis Intelligence Index? The 9 Evals Behind the Number》
  • Cohere Labs 等《The Leaderboard Illusion》(arXiv, 2025-04)
  • LMCouncil / AI Explained 独立基准汇总(lmcouncil.ai)
  • DataLearner AI 开源大模型排行榜(datalearner.com)
主要菜单