← 文章 / AI技术
Simon Willison 2天前 · 2026-07-23 17:15:43 · 5 阅读

AI实验室在搞“鹈鹕最大化”吗?

AI实验室在搞“鹈鹕最大化”吗?via)Dylan Castillo 的这篇作品非常出色,他深入研究了那个经常被思考的问题:AI实验室是否在故意训练模型,以响应我的极其不科学的基准测试,来画“鹈鹕骑自行车”。

我之前也随机抽查过,让模型画其他动物骑其他交通工具,但远没有 Dylan 这里的方法那么严谨。

Dylan 设计了 8 种动物 × 6 种交通工具 = 48 条提示词,对 7 个不同模型(GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2 和 DeepSeek V4 Pro)各跑了三轮。然后他用 GPT-5.6 Luna 和 Gemini 3.1 Flash-Lite 来帮助评估结果。

还有一个漂亮的筛选视图可以探索结果:

GLM-5.2 第 1/3 批样本的网格截图,包含鹈鹕、火烈鸟、苍鹭骑自行车、独轮车、滑板、滑板车、飞机和船

对于他测试的模型,没有发现“鹈鹕最大化”的证据:

鹈鹕并不比其他动物画得好,自行车也不比其他交通工具画得好。没有哪个实验室能画出比其鹈鹕和自行车各自表现所预测的更好的组合。GLM-5.2 最接近:它在“鹈鹕骑自行车”这个特定单元格上提升最大,它的第一张鹈鹕骑自行车样本也引起了我的注意。但效果很小且不显著,所以我不太看重它。

原始来源: Simon Willison

评论 (0)