这两天掘金上有两篇文章在讨论同一份榜单,结论却互相"打架"。 一篇是《民间AI排行榜单新鲜出炉,Fable 5.1仅排第三》(作者 石小石Orz):B 站不少 UP 主用贴近现实、条件更苛刻的场景对大模型"整活"式测试,榜单里 `GPT-6 Astra` 领先,`GML-5.3` 紧随其后,`Claude Fable 5.1` 仅排第三。作者直言有点意外——Fable 5 常被夸得天花乱坠,这次却在国内被 GML-5.3 压了一头。 另一篇是《如何看待GPT-6在UP主众测中碾压夺冠?它是现在最强大模型吗?》(作者 苏三说技术),它揭示了一个更要紧的事实:同一个 GPT-6,在不同 UP 主的视频里表现完全不同。 代码修复类测评里它稳,游戏开发类测评里偶尔翻车,生活决策类里甚至不如某些国产模型。同一大方向"修 BUG",不同 UP 主出题的冠军也不同:GPT-6 在工程执行上强,GLM-5.3 在祖传代码测试中榜首,Claude Fable 5.1 在分阶段对抗性修复上登顶。 没有哪个模型在所有真实场景里"碾压",这件事本身就是今天最值得创作者知道的信息。 一、榜单为什么互相矛盾:三把不同的尺子 第一篇把评测体系梳理得很清楚,大致分三层: · 静态 Benchmark(MMLU、GSM8K 这类):固定题库、答案清晰、流程可复现,横向可比性强,但容易被刷榜,区分度越来越低; · 动态学术基准(LiveBench、SWE-bench Verified):题库持续换新,防背题,兼顾严谨与新鲜; · 民间实测(如 B 站 AI 无限竞技场):出题权在使用者手里,考的是真实工作里的活。 三者谈不上谁取代谁,"更像三把不同的尺子"。而这恰好解释了矛盾:榜单测的是"在它定义的能力集合里谁更强",不是"谁在所有场景更强"。 民间榜单也不是权威判据。第一篇列出了它的边界:考题偏向创作类、生活化任务,对硬核科研与工业级 Agent 任务覆盖不足;人工打分难免主观,又没有 LMSYS Arena 那类强制匿名双盲机制来消除品牌滤镜;样本量有限,几十场 PK 统计不出完整的能力分布。 二、数字会骗人:同一个模型,两个 SOTA 第二篇里有一组我认为最该被记住的数据。 GPT-6 在 ARC-AGI-3 上的成绩常被引用为 99.9%。但这个数字有个关键背景:ARC Prize 官方在标准 harness 下测出来的是 62.7%,只有在 Provider Adapter harness 下才是 99.9%。两者都是 GPT-6、都来自 ARC Prize、都被称为 SOTA——差别在于标准 harness 限制了模型能"记住"多少东西,而 Provider Adapter 允许模型携带笔记。 同一篇文章还引了两组更扎心的数据:2026 年 5 月上海人工智能实验室联合多所高校发布的 WildClawBench(60 道全部模拟真实工作场景的任务,包括爬论文、审计代码仓库、排查 Git 历史中的 API Key 泄露等),表现最好的模型得分仅 51.6%;中国人民大学高瓴人工智能学院的 BeyondSWE 基准发现,顶尖模型通过率跌到 45% 以下。 另一个案例是 Kimi K3:7 月发布时开源了 2.8 万亿参数权重、支持 1M 上下文、拿过前端榜全球第一,按传统跑分绝对属于第一梯队,却在 B 站真实场景测评里连榜单都没进。 论坛里有人不信,最高赞回复只有一句:"评分和实际场景不是一回事。" 三、落到自己身上:一份可用的选型法 结合这两篇,我给自己定了一套更耐用的判断顺序,比"看哪个分高"可靠得多: 1、先确定你要考的那类任务。 模型能力是分化的,不存在一个"总分"。你要的是代码修复、前端生成、还是长文档处理?只在同一类任务的评测里比。 2、至少两个来源交叉。 官方 Benchmark 看横向可比,民间实测看实际手感;只看一个 UP 主的视频,等于把一个人的主观当成了标准。 3、查口径,不只看分数。 看到 99.9% 这种极端数字,先问"是哪个 harness、有没有携带外部记忆"。口径不同,数字没有可比性。 4、最后一定要自己跑一遍。 第二篇作者自己的体感是:同一个模型写业务逻辑很顺手,让它猜产品经理的意图就开始胡言乱语——模型不是越贵越好,是越匹配你的场景越好。 顺便说,第一篇作者在文末给了一套很朴素的"私人榜单"标准,我觉得比很多评测都实用:价格实不实惠、有没有饥饿营销、响应快不快,以及最关键的一条——能不能真正帮你干活变现,而不是让你付费上班、给 AI 打工。 结语 2026 年的 AI 评测正在从"考试"走向"实战"。官方 Benchmark 适合横向比较,真实场景测评适合判断实际使用体验,两者合在一起才看得清一个模型的全貌。 所以下次再看到"某模型碾压夺冠",不妨先问一句:它碾压的是哪一类任务?谁出的题?口径是什么? 一个模型在某个榜单上拿了第一,不代表它在所有真实场景里都更强——它可能只是恰好撞上了出题人设计的那类任务。而你要解决的,从来是你自己的那一类。 参考链接 《民间AI排行榜单新鲜出炉,Fable 5.1仅排第三》:https://juejin.cn/post/7686044352167575604 《如何看待GPT-6在UP主众测中碾压夺冠?它是现在最强大模型吗?》:https://juejin.cn/post/7686347234725068843
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。