2024 年 10 月 25 日,英国程序员 Simon Willison 给手边能用的 16 个大模型丢了同一句话: > Generate an SVG of a pelican riding a bicycle 然后他把结果一张张贴出来,说这是他自己的模型评测。 题目本身不讲理。他后来解释过为什么挑这个:他喜欢鹈鹕,他住在加州半月湾,海边就有;而且他很确定——互联网上还没有一张"鹈鹕骑自行车"的 SVG,模型不可能在训练数据里见过答案。更关键的一点是,大语言模型本来是文字模型,按理说不会画画,但它们会写代码,而 SVG 恰好就是代码。于是这等于让一个看不见东西的系统,凭坐标和半径把形状拼出来,全程不知道自己画成了什么样。他自己在演讲里的原话更直接:鹈鹕根本骑不了自行车,它们的身材就不对。 原文:Pelicans on a bicycle 一、它曾经真的测出过东西 头几个月的画作惨不忍睹。Claude 3.5 Sonnet 交出来两个圆中间连一个三角形,喙像一根黄色的香蕉笑脸;Llama 3.3 70B 画了一个小圆圈、一根竖线,还有一个形状像水槽的东西;Qwen2.5-Coder 的自行车是几块棕色形状叠在一起,像台拖拉机。 到了 2025 年 6 月,Willison 在旧金山 AI 工程师大会做主题演讲时手里已经攒了 34 张鹈鹕。他懒得自己一张张看,就让 Claude 写了个小工具把任意两张并排截图,两两配对一共 560 场对决,每场交给 GPT-4.1 mini 当裁判选"更好的鹈鹕骑自行车插画"并说明理由,最后用 Elo 积分解出排名。整个裁判过程花了大约 18 美分——冠军是 Gemini 2.5 Pro 的一个预览版,垫底的是 Llama 3.3 70B。同一场演讲他还算了账:o1-pro 画一只鹈鹕花了 88.755 美分,Gemini 2.5 Pro 画一只花了 4.77 美分,画出来还是 Gemini 更好。 这一年里,各家的鹈鹕从一堆色块慢慢变成能认出来的东西,而且鹈鹕的好坏和模型的实际能力,基本对得上。Willison 说这个测试本来是个玩笑,用来嘲笑"比较模型"这件事有多荒唐,结果玩笑越玩越像真的。 二、玩笑开始不灵了 转折点出现在 2026 年。他把这句话丢给一堆模型,结果开始偏离常识。 2026 年 4 月 16 日,阿里的 Qwen3.6-35B-A3B 和 Anthropic 的 Claude Opus 4.7 同一天发布。他用一个 20.9GB 的量化版在自己笔记本上跑 Qwen,又用官方 API 跑 Opus,把这一局判给了 Qwen:Opus 把车架画错了,换最高推理档位再来一次,还是错。他自己的评语很克制——非常尊重 Qwen,但不相信一个 21GB 的量化模型比 Anthropic 最新旗舰更有用;只是如果你要的东西就是一张鹈鹕骑车的 SVG,那此刻笔记本上的 Qwen 确实更靠谱。原文:Qwen3.6-35B-A3B on my laptop drew me a better pelican 7 月 Kimi K3 发布,他照例让它画鹈鹕。这只鹈鹕消耗了 95 个输入 token、16658 个输出 token(其中 13241 个是推理 token),成本 25 美分。紧接着他写了一节"我们还能从鹈鹕测试里学到什么",结论很斩钉截铁:这个测试已经 21 个月,从来就不是一个好的评测;头一年它和模型真实水平有出人意料的相关性,现在这条线基本断了。GPT-5.6 和 Claude Fable 5 的鹈鹕都被 GLM-5.2 比下去了,而他不认为 GLM 是 Fable 那个级别的模型。他的原话是:别拿鹈鹕去比较模型。原文:Kimi K3, and what we can still learn from the pelican benchmark 他还点出了这个测试最大的盲区:鹈鹕完全测不到今天最要紧的能力——模型能不能在长对话里稳定地调用工具。这恰恰是企业真正付钱买的东西。 三、但一个提示词暴露的信息量,仍然惊人 有意思的是,Willison 并没有停。他给的第二个理由是:一句提示词,就能暴露不少东西。 Kimi K3 那次他就发现,"Generate an SVG of a pelican riding a bicycle"这句话被算成了 95 个输入 token。作为对比,他自己的 LLM CLI 工具和第三方计数器对这个句子的统计都在 10 个 token 上下。他进一步做了个测试:只发一个 "hi" 给 Kimi K3,计到 86 个 token——这暗示背后藏着一段大约 85 个 token 的系统提示。他试着让模型把这段提示说出来,被拒绝了。 同样的方法还能量出别的东西。2025 年 8 月,他跑了个 4B 的小模型 Qwen3-4B-Thinking,它没画自行车,画了一个蓝色的圆,上面盖了一行红字:"This is art - pelicans don't ride bikes!"——他就把这句话做成了文章标题。 再往后,2026 年 9 月 1 日 Claude Fable 5.1 发布,他拿同一个模型的五个推理档位各画一轮:低档和中档二十来秒出图;最高档跑了 13 分 54 秒、输出 65927 个 token、花了 3.3 美元。原文:Claude Fable 5.1 made me a really nice animated pelican 四、它已经从评测变成了别的什么 如今这件事的规模早就超出"一张图"。有人把散落在 Willison 两年几十篇文章里的鹈鹕全抓了出来,建了个站:pelicanzoo.ai,目前关着 103 只鹈鹕,来自 66 个模型、12 家厂商,时间从 2024 年 10 月一直排到 2026 年 9 月。每一只都标着模型名和日期,点进去能回到原文。其中 24 只是"活的"——原始矢量文件还在,页面上能无损放大,有 4 只还带动画。 站上还留了翻车合集:好几个模型画出来是鸭子,白身子、橙嘴、蹼足,理直气壮;有一只是苍鹭;有两只是火烈鸟骑独轮车;最离谱的一只来自 GLM——画了一只负鼠,骑电动滑板车,还带动画。 五、对做产品的人,这里有三条能用的结论 第一,小样本趣味测试的价值不在排名,在于它逼你真的去跑一遍。Willison 自己说得很清楚:贴出一只鹈鹕,就意味着他确实跑通了这个模型,而不是光看了发布会。这对团队同样成立——选型阶段与其读十篇测评,不如拿自己最典型的一个真实请求,在候选模型上各跑一遍,记录耗时、token 数和成本。 第二,判断一个模型时,要问它测不到的维度。鹈鹕能测出几何感、成本、推理档位的差异,测不出长对话里的工具调用稳定性、上下文压缩后的行为、以及错误恢复。而后者才是线上系统真正出事的地方。用错的指标做决策,比没有指标更危险。 第三,单句提示词的 token 账,是免费的体检。发一句 "hi"、看它消耗多少输入 token,就能估出隐藏系统提示的规模;看一次简单任务的输出 token 里推理占多少,就能估出这张账单会怎么涨。这类数字不需要付费订阅,也不需要实验室白盒。 一个玩笑测试跑了 21 个月,最有价值的产出不是"哪个模型第一",而是发明它的人亲口说的那句"别拿它比较模型"——以及他仍然坚持画下去的理由。这两件事并不矛盾:好的评测会过期,好的习惯不会。 主要来源 · Simon Willison,Pelicans on a bicycle,2024-10-25 · Simon Willison,The last six months in LLMs, illustrated by pelicans on bicycles,2025-06-06 · Simon Willison,Qwen3.6-35B-A3B on my laptop drew me a better pelican than Claude Opus 4.7,2026-04-16 · Simon Willison,Kimi K3, and what we can still learn from the pelican benchmark,2026-07-16 · Simon Willison,Claude Fable 5.1 made me a really nice animated pelican,2026-09-01 · 鹈鹕动物园:pelicanzoo.ai 参考链接 Pelicans on a bicycle:https://simonwillison.net/2024/Oct/25/pelicans-on-a-bicycle/ Qwen3.6-35B-A3B on my laptop drew me a better pelican:https://simonwillison.net/2026/Apr/16/qwen-beats-opus/ Kimi K3, and what we can still learn from the pelican benchmark:https://simonwillison.net/2026/Jul/16/kimi-k3/ Claude Fable 5.1 made me a really nice animated pelican:https://simonwillison.net/2026/Sep/1/claude-fable-5-1/ pelicanzoo.ai:https://pelicanzoo.ai The last six months in LLMs, illustrated by pelicans on bicycles:https://simonwillison.net/2025/Jun/6/six-months-in-llms/
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。