
如果你每天都刷大模型的排行榜,你会陷入一种「榜单焦虑」:今天 A 模型登顶,明天 B 模型反超,后天又冒出一个 C 模型「碾压全场」。而当你仔细去看这些「第一」,会发现它们来自完全不同的来源——有的是盲测投票,有的是机构自跑,有的干脆是厂商自己在报告里写的。同一个模型,在这三种「实测」里,可能分别是第一、第三和「无从考证」。
这篇横评,不打算再给你一份「谁最强」的排行榜——那只会加重焦虑。我们要做的是把「实测」这件事本身拆开:2026 年主流的横评到底有哪几种做法、各自测的是什么、有什么坑,以及当你面对一份横评时,怎么在 30 秒内判断它值不值得信。文末附上 2026 年 8 月实测横评的月度赢家,和一份避坑自查清单。
一、速览卡:四种「实测横评」横向对比
| 横评类型 | 代表 | 怎么测 | 最容易骗你的地方 |
| 盲测投票 | Arena / LMArena | 匿名 A/B,真人选赢家 → Elo | 偏好≠能力,风格可压实质,可刷 |
| 独立跑题 | Artificial Analysis / LMCouncil | 机构自跑统一评测,pass@1 | 范围窄(纯文本/英文),更新慢 |
| 厂商自报 | 各技术报告 | 厂商自己跑、自己选脚手架 | 选择性披露,数字不可横向比 |
| 真人月度横评 | Fello AI 等 | 综合多源 + 真实使用体验 | 主观,结论有时效性 |
二、为什么「实测」会有四种截然不同的答案
先讲一个 2026 年最典型的例子。在代码能力这件事上,四份「实测」给出了四个答案:SWE-bench 说 Claude Fable 5 第一(95%),LMArena 的 WebDev 投票榜说 Kimi K3 第一(1682 分),Artificial Analysis 的 Coding Index 说 GPT-5.6 Sol 和 Claude Opus 5 并列第一(78.3 vs 78.0,只差 0.3 分算打平),而 Meta 的 Muse Spark 1.3 在厂商自己的图表上「三项编码全胜」。
四个第一,谁也没造假。它们的分歧,源于一个根本问题:「写代码写得好」这个能力,本身就不是一个可以单一测量的东西。修真实 bug、刷竞赛题、做网页、写生产代码,是四种不同的代码能力。不同的横评,测的是不同的那一面。所以「实测」的答案不统一,不是横评不行,而是「能力」这个词被过度简化了。
三、盲测投票横评:Arena 的真实与陷阱
先交代一下「Arena」这个名字的来历,因为它折射出横评行业的快速演化。这个项目 2023 年诞生时叫 LMSys Chatbot Arena(出自 UC Berkeley 的 LMSys 实验室),2024–2025 年更名为 LMArena,2026 年 1 月又进一步简化为 Arena。短短三年改了三次名字,背后是它从一个大学研究项目、逐步独立成商业化评测平台的轨迹。你在一篇老文章里看到的「Chatbot Arena」和一篇新文章里的「Arena」,其实是同一个东西的不同时期。
3.1 它为什么被最广泛引用
Arena(原 LMArena,再之前叫 Chatbot Arena)是 2026 年最常被引用的「横评」。它的机制前面已经讲过:你出题、两个匿名模型各答一版、你投票、系统用 Elo 汇总。它被广泛引用,是因为它规模大(文本榜 770 万+ 票、389 个模型)、更新勤、而且它是唯一一个直接测量「真人偏好」的榜单——它回答的是「大家更爱用谁」,这是任何客观测试都测不出来的。
3.2 但它的三个陷阱,多数人不知道
第一,「偏好」不等于「能力」。投票者常常被自信的语气、工整的排版带偏,哪怕内容并不更准确。Arena 后来加了「风格控制」开关,正是为了对抗这一点,但它只能缓解、不能根除。
第二,它可以被刷。2025 年 4 月的论文《The Leaderboard Illusion》披露了 Meta 用 27 个私有变体在发布前测试、并选择性披露结果的操作,以及闭源模型被抽样进对决的次数显著高于开源模型。Arena 虽然回应了,但这个「刷榜」的故事已经成为它最公开的污点。
第三,Elo 分数的解读有门槛。100 分差距 ≈ 64% 胜率,200 分 ≈ 76%,25 分以内是噪声。但很多报道把「领先 5 分」写成「碾压」,完全无视这个刻度。
四、独立跑题横评:Artificial Analysis 与 LMCouncil
4.1 Artificial Analysis:最接近「实验室」的做法
Artificial Analysis 的 Intelligence Index 是目前最接近「独立测量实验室」的横评。它自己运行每一轮评测、用内部数据集副本、统一 pass@1 设定,不给厂商自报数字任何机会,还给结果估了 95% 置信区间(误差小于 1 分)。这是它的最大价值——分数在厂商之间真正可比。
但它也有明确的边界:纯文本、纯英文,且完全不测「人类喜不喜欢」。所以它的结论和 Arena 打架,是必然的——一个测任务能力,一个测偏好。而且它更新相对慢,像 Claude Fable 5.1 这种 9 月 1 日才发布的模型,Arena 还没来得及给它投票,两家榜单的「时差」会制造出大量「谁才是第一」的假争论。
4.2 LMCouncil:把「独立」再推进一步的聚合
LMCouncil(由 AI Explained 团队维护)的价值在于,它只汇总独立机构(Epoch、Scale 等)跑的评测,明确排除厂商自报数字。它的首页就写着:「独立运行的基准,可能与 AI 组织的自报分数不符」。它覆盖的 Humanity’s Last Exam、SimpleBench、METR Time Horizons、SWE-bench Verified 等,是当前最「硬」的一套独立横评数据。做严肃选型时,这套数据比任何单一厂商报告都更可信。
4.3 读懂横评里的「置信区间」和「噪声」
一份靠谱的横评,一定会给分数配上不确定性,而大多数报道会把这个关键信息丢掉。以 LMCouncil 的数据为例,几乎每一项都带着「±」的误差棒:Humanity’s Last Exam 的 Gemini 3.1 Pro 是 46.4% ±2.0,GPQA Diamond 的 GPT-5.4 Pro 是 94.6% ±1.6,SWE-bench Verified 的 Claude Opus 4.7 是 83.5% ±1.7。
这些「±」是什么意思?它告诉你:第一名和第二名之间的差距,可能根本没有超出误差范围,也就是说,那个「第一」其实是个并列。比如 GPQA Diamond 上 94.6% 和 94.1%(第二名)只差 0.5 个百分点,而误差棒有 ±1.6——这几乎可以断定是打平。但大多数「榜单盘点」会把这个并列渲染成「碾压式登顶」。
所以读横评的第二课是:先看误差棒,再看名次。一个带着「±2.0」的 46.4%,和一个不带误差的 46.4%,是完全不同的两句话。前者是「谨慎地说,它和另外几款在统计上难分高下」,后者是「它就是第一」。负责任的横评会给你前者,营销号会给你后者。
五、一个经典案例:Kling 3.0 的 137 分「名次漂移」
在讲厂商自报之前,先用一个真实的案例,让你直观感受「横评的不稳定性」。
视频生成模型 Kling 3.0 1080p Pro,在 Artificial Analysis 4 月 30 日的快照上排第 3(1248 Elo);而到了 7 月 22 日 AA 的实时榜单上,它已经掉到第 6(1111 Elo)。同一个模型,相隔 83 天,名次下滑 3 位、Elo 跌了 137 分。这不是模型变差了,而是「榜单是某个具体日期的快照,不是固定的质量排名」这句话的活教材。TryInfer 在梳理这个案例时点破了根本原因:Elo 评分每小时都在重算,任何一次截图,充其量只是「几小时前的排名」。
这个案例的教训有两条:第一,任何横评数字都要带上日期,否则就是拿「旧排名冒充当前数据」;第二,「Elo 跌了」不等于「模型变差了」,因为 Elo 是相对分,新模型的加入、投票样本的变化,都会让老模型的分数被动浮动。看懂这一点,你就能对「XX 模型暴跌/暴涨」这类标题党免疫。
六、厂商自报:最该警惕的「横评」
厂商自报的评测数字,是最常见、也最需要警惕的「横评」。问题不在厂商会撒谎——而是在「选择性披露」和「脚手架不统一」这两件事上。
前者:厂商在技术报告里,天然倾向于报对自己有利的基准、藏起不利的。GLM 5.3 发布时,Z.ai 的图表显示它 Terminal-Bench 3.0 从 4.6 跳到 28.3、DeepSWE 从 46.2 跳到 66.9,声称「逼近 Claude Mythos 5」;但同一张图表里,它自家 Code Bench 上 Claude Fable 5 仍以 39.5% 领先 GLM 5.3 的 31.4%,ExploitBench 上更是 78.0% 对 54.4%。felloai 对此的评价一针见血:「这些数字每一个都是厂商的,还没有独立审计」。
后者:同一个模型,换一套 prompt 脚手架,分数能差出一大截。厂商自报的「第一」,往往是「某套特定脚手架下的第一」,脱离那个条件就不成立。所以 Opper 那篇榜单方法论文章给出的原则是:「供应商启动数字」这一栏,永远不能跨厂商比较。
七、2026 年 8 月实测横评的月度赢家
在列赢家之前,先给横评来源做一个「信任度分级」,因为它决定了下面这些结论你该信几分。粗略地说:第一档是「独立机构实测」(Artificial Analysis、Epoch、Scale、LMCouncil 汇总),它们自己跑题、可复现,可信度最高;第二档是「盲测投票」(Arena),规模大、更新勤,但测的是偏好且有刷榜史,可信但需警惕;第三档是「第三方媒体横评」(felloai、Opper 这类),它们整合多源、给出带判断的结论,对选型最友好,但主观、有时效;第四档是「厂商自报」,只能当作参考,不能当作结论。下面这份月度赢家,尽量锚定在前三档的交叉共识上。
综合 Arena 投票、Artificial Analysis、LMCouncil 独立基准、以及 felloai 这种真人月度横评,2026 年 8 月的「实测」赢家可以这样概括(数据截至 2026 年 8 月底):
| 分类 | 月度赢家 | 依据 |
| 综合/写作 | Claude Fable 5 | Arena 文本榜第一(1508.6),唯一同时进入三个独立写作榜前三 |
| 编码 | Claude Opus 5 | WebDev 1702.9 + image-to-WebDev 1668.6 双榜第一,价格是 Fable 5 一半 |
| 性价比编码 | Grok 4.6 | Intelligence Index 61,长时任务轮次约为 Opus 5 一半,$2/$6 |
| 准确性/研究 | Gemini 3.1 Pro | ARC-AGI-1 98%,原生 Google 搜索接地 |
| 难题求解 | GPT-5.6 Sol | LiveBench 数学/推理 + ARC-AGI-2 领先 |
| 开源权重 | Kimi K3 / GLM 5.3 Flash | K3 为最强开源、WebDev 第二;GLM 5.3 Flash 为 MIT 开源之选 |
注意这张表的措辞——「月度赢家」而不是「最强」。因为正如开头所说,这些结论都有时效性:9 月 1 日 Claude Fable 5.1 一发布,AA 综合榜首就易主了;9 月 2 日 Qwen3.8-Max-0902 又在 WebDev 上反超了三分(尽管幅度在噪声范围内)。任何「最强」的结论,有效期都短得惊人。
八、自己动手:怎么做一次靠谱的「个人横评」
看再多别人的横评,也不如自己跑一次针对你任务的横评。这里给一套可操作的流程,不需要任何专业评测工具。
第一步,准备一个「你自己的测试集」。从你真实的工作里扒 20–30 个有代表性的任务——比如你常写的 10 段代码、常读的 10 份文档、常答的 10 个问题。不要用网上现成的「通用测试题」,因为通用题测的是「别人的任务」,不是你的。
第二步,用同一套 prompt 跑两三个候选模型。关键是要盲测——把模型名字抹掉、随机排序,避免「大厂滤镜」影响你的判断。可以借助 Arena 这种平台的匿名模式,也可以自己把结果打乱再评。
第三步,按「对错 + 可用性」打分,而不是凭感觉。对代码,看能不能跑通、有没有 bug;对文档,看提取的信息准不准;对问答,看有没有编造。把「正确」和「喜欢」分开记分——前者是能力,后者是偏好,混在一起就重蹈了 Arena 的覆辙。
第四步,把成本也算进去。记录每个模型完成这些任务的耗时和 token 消耗,换算成真实成本。往往这一步做完,你会发现「综合分最高的」和「综合最划算的」根本不是同一个模型。
这套流程一天就能做完,但它的结论比任何第三方横评都更贴合你。因为横评的终极答案,从来不是「谁最强」,而是「谁对你最合适」——这个答案,只有你自己的任务能给。
九、横评的局限:为什么它们永远在「打架」
横评之间的分歧,是结构性的,不是偶然的。根源有三。
第一,「能力」是多维的,单一榜单只能测一维。代码、数学、推理、写作、多模态、智能体,各有各的基准,各有各的王者。指望一张榜单给全貌,本身就是奢望。而「综合榜」试图把这些不可通约的维度加权成一个数,这个加权本身就是一种主观选择——为什么智能体占 34%、代码只占 24%?没有标准答案,于是不同榜单的权重不同,结论自然不同。
第二,方法论决定了盲区。盲测投票被风格带偏,独立跑题范围太窄,厂商自报不可比,真人横评太主观。每种方法都「测准了一部分、也测漏了一部分」。
第三,时间是最大的敌人。模型更新太快,榜单时差、版本漂移、引导价到期,让任何横评在发表的那一刻就开始过时。这也是为什么「历史排名不得冒充当前数据」成了负责任的评测档案必须声明的一条。
十、总结:一份 30 秒横评避坑自查清单
下次你看到一份「大模型实测横评」,用下面这五条在 30 秒内过一遍,基本能滤掉 90% 的坑:
- 问来源:数字来自盲测投票、独立机构、还是厂商自报?厂商自报的,先打个问号。
- 问版本和时间:哪个榜单、哪个版本、哪天测的?跨版本、跨时间的数字不能直接比。
- 问「测的是什么」:它测的是偏好、任务能力、还是固定题目?这三者结论常常相反。
- 问置信度:差距有没有置信区间?1 分差距和 10 分差距,是两码事。
- 问「对我有什么用」:它的结论,是不是对应你要做的那件事?一个「综合第一」对你写代码,可能毫无意义。
把这五条记住,你就能从「被榜单牵着走」的人,变成「会读榜单」的人。横评的真正价值,不在于告诉你一个第一,而在于帮你把「谁最强」这个错误的问题,换成「谁最适合我做这件事」这个正确的问题。
参考来源
- Opper AI《LLM rankings in 2026: how leaderboards work and which to trust》
- Fello AI《Best AI Models in 2026》(8 月分类赢家、GLM 5.3 审计、Grok 4.6 轮次数据)
- LMCouncil / AI Explained《AI Model Benchmarks Jul 2026》(HLE / SimpleBench / METR / SWE-bench)
- Cohere Labs 等《The Leaderboard Illusion》(arXiv, 2025-04) 及 Arena 官方回应
- Artificial Analysis Intelligence Index v4.1 / v4.2 方法论
- The Vibefather《What Is the Artificial Analysis Intelligence Index?》
- TryInfer《How AI video leaderboards actually work》(Elo / Bradley-Terry 机制)
- 百度百科「Artificial Analysis 榜单」词条