
本页目录
测试方法、证据 1:骑在自行车上的鹈鹕图像看起来没更出色、证据 2:AI 实验室绘制鹈鹕的能力并不突出、证据 3:AI 实验室绘制自行车的能力也不突出、证据 4:即便考虑难度因素,AI 实验室绘制骑在自行车上的鹈鹕的能力也不强、证据 5:骑在自行车上的鹈鹕场景并非记忆式构图、局限性、结论
AI 实验室是否在针对“鹈鹕骑自行车”进行优化?
过去几年里,西蒙·威利森每次在主要大语言模型(LLM)发布时,都会用相同的提示语进行测试:“生成一幅鹈鹕骑自行车的 SVG 图像”。这个起初带有玩笑性质的基准测试,如今已成为人工智能领域最著名的非正式基准测试之一。西蒙的“鹈鹕骑自行车”测试结果,常常在 Hacker News 上有关 AI 实验室新模型发布的讨论帖中获得大量点赞。如今,这个基准测试的知名度极高,网上有很多关于其有效性的讨论,也有人质疑 AI 实验室是否会为了在这个测试中取得好成绩而进行“基准优化”。为了找到答案,开展了一个小型实验,在七个前沿模型上生成了 1008 张 SVG 图像,用一个大语言模型作为评判器对这些图像进行打分,并使用 Claude Fable 5 进行数据分析。本文将呈现实验结果。
1. 测试方法
设计了一个由 8 种动物和 6 种交通工具组合而成的 48 个提示语网格,其中“鹈鹕骑自行车”提示语只是其中一格。动物包括鹈鹕、火烈鸟、苍鹭、水獭、浣熊、羚羊、鲸鱼、猫;交通工具包括自行车、独轮车、滑板、踏板车、飞机、船。每个提示语的表述与西蒙的基本相同,只是替换了动物和交通工具。通过 OpenRouter 测试了七个模型:_GPT - 5.6 Terra_、_Claude Sonnet 5_、_Gemini 3.5 Flash_、_Grok 4.5_、_Qwen3.7 - Max_、_GLM - 5.2_ 和 _DeepSeek V4 Pro_。每个提示语生成 3 个样本,温度参数设为 1.0,并要求每个模型付出相同的推理努力,最终共生成了 1008 张 SVG 图像。然后,将每张图像通过一个三阶段的处理流程:一是渲染,将每张 SVG 图像渲染为 PNG 格式,记录重试次数;二是评判,使用 _GPT - 5.6 Luna_ 对每张图像中的动物、交通工具以及动作的连贯性进行 1 - 5 分的评分;三是特征提取,将每张渲染后的图像输入 _Gemini 3.1 Flash - Lite_,识别图像中的动物和交通工具、主体的朝向以及场景元素的开放式列表。假设如果某个实验室针对这个基准测试进行了训练,那么在评分中应该会出现鹈鹕所在行的得分高于该动物应有的水平、自行车所在列的得分高于该交通工具应有的水平、或者“鹈鹕骑自行车”这一特定组合的得分同时高于鹈鹕和自行车的单独得分的情况。
2. 证据 1:骑在自行车上的鹈鹕图像看起来没更出色
在进行评分之前,亲自查看这些图像,但并没有发现明显的差异,找不到任何一个模型,其“鹈鹕骑自行车”的图像明显优于该模型生成的其他动物 - 交通工具组合的图像。总体而言,这些图像与每个模型生成的其他图像并无明显区别,那些能画好“鹈鹕骑自行车”的实验室,在绘制其他动物 - 交通工具组合时也表现不错。但这种测试方法很难重复,且每个人的看法可能不同,因此需要更具量化性的方法。
3. 证据 2:AI 实验室绘制鹈鹕的能力并不突出
所有模型对每种动物的平均评分显示,鹈鹕在 8 种动物中排名第 6,落后于猫、鲸鱼、浣熊、苍鹭和羚羊。如果 AI 实验室针对这个基准测试进行了训练,那么鹈鹕应该排在前列,但实际上它处于后半段。所有七个实验室绘制猫、鲸鱼和浣熊的能力都比绘制鹈鹕强。不过,鹈鹕可能本身就比猫更难画,仅根据这个排名还不能排除实验室针对鹈鹕进行训练的可能性,后续将在证据 4 中考虑难度因素。
4. 证据 3:AI 实验室绘制自行车的能力也不突出
自行车的表现更差,仅比飞机略好,与飞机几乎并列倒数第一。如果实验室针对这个基准测试进行了训练,那么自行车应该在这个排名中靠前,但实际并非如此。不过,自行车比滑板更难画,评判器在三分之二的自行车图像中都标记了缺少或未连接的部件。即使实验室针对自行车图像进行了训练,相对于更简单的交通工具,其表现可能仍然不佳。另外,关于“飞机”,本应选择“airplane”而不是“plane”,因为模型通常会从几何角度理解“plane”,它们绘制的图像中,动物站在一个平面上,而不是驾驶飞机。在所有交通工具中,只有“飞机”图像有时会被特征提取器识别为没有交通工具,并且 20% 的“飞机”图像在交通工具评分中只得到 1 或 2 分,而自行车的这一比例为 5%,船、踏板车和滑板则为 0。
5. 证据 4:即便考虑难度因素,AI 实验室绘制骑在自行车上的鹈鹕的能力也不强
将动物和交通工具的评分综合起来,“鹈鹕骑自行车”在 48 种组合中排名接近末尾,位列第 42。为考虑组合本身难度因素,对所有 1008 张图像进行了固定效应回归分析。结果显示:每个实验室在所有六种交通工具上绘制鹈鹕的额外提升均不显著;每个实验室在所有八种动物上绘制自行车的额外提升有正有负,只有 _Gemini 3.5 Flash_ 的结果通过了 p < 0.05 的显著性检验;没有一个实验室在“鹈鹕骑自行车”这一特定组合上的额外提升通过了 p < 0.05 的显著性检验。每个鹈鹕相关的区间和每个组合相关的区间都包含零,只有一个区间不包含零,即 _Gemini 3.5 Flash_ 在自行车列的区间,但在多重比较校正后也不显著。不过,这些区间较宽,平均约为 ±0.6 分,任何小于这个范围的提升都可能无法通过本次测试检测到。
6. 证据 5:骑在自行车上的鹈鹕场景并非记忆式构图
有人认为“鹈鹕骑自行车”的图像看起来像是记忆式构图,因此进行验证。在朝向方面,所有七个实验室生成的 21 张“鹈鹕骑自行车”图像中,鹈鹕都朝右,但朝右是比较常见的情况,其他组合也有接近一致的情况,所以 21 张图像主体都朝右并不显得特别异常。在场景元素方面,让特征提取器识别图像中的所有元素并统计出现次数,发现“鹈鹕自行车”组合并没有什么特别之处,它只是像其他动物 - 交通工具组合一样,有一些元素出现的频率较高。
7. 局限性
一是评分仅使用单一的大语言模型评判器,本文中的所有评分均来自 _GPT - 5.6 Luna_ 这一个模型,且未对评判器进行太多的对齐调整,也未检查它在重新评分时的一致性。不过,每个实验室都生成了所有 48 种组合,所以如果评判器恰好喜欢某个实验室的风格,并不影响分析结果。二是 SVG 优化,如果一个实验室对 SVG 图像生成进行了整体优化,那么它在每个组合上的得分都会提高,这与本身表现出色的实验室难以区分,本次实验无法检测到这种情况。三是预算有限,整个实验仅花费了约 80 美元的 API 费用,这限制了每个组合只能生成 3 个样本,只能使用一个评判器,并且只能测试 7 个模型,也导致无法对提示语和处理流程进行过多的迭代优化。
8. 结论
目前几乎没有证据表明 AI 实验室在针对“鹈鹕骑自行车”进行优化,至少它们没有以明显的方式进行优化。鹈鹕的绘制效果并不比其他动物更好,自行车的绘制效果也不比其他交通工具更出色。_GLM - 5.2_ 是最接近有显著效果的实验室,但这种效果较小且不显著。另外,所有 21 张“鹈鹕骑自行车”图像中的鹈鹕都朝右,但这似乎并不奇怪,在整个实验中朝右是比较常见的方向。更有可能的情况是,实验室像谷歌/DeepMind 那样进行 SVG 优化,其他实验室可能只是做得更隐蔽。遗憾的是,本次实验无法确定哪些实验室在进行这种优化,但可以放心的是,AI 实验室并没有为了欺骗西蒙·威利森而生成海量的“鹈鹕骑自行车”图像。

298

被折叠的 条评论
为什么被折叠?



