AIラボはPelicanmaxxingしているか?実験結果
मूल शीर्षक: Are AI Labs Pelicanmaxxing?
यह क्यों महत्वपूर्ण है
AI labsがbenchmarkに特化した最適化を行っているかを定量的・定性的に検証した事例として、評価手法の信頼性議論に貢献する。
Dylan CastilloはAI labsが「ペリカンが自転車に乗るSVG」という有名な非公式benchmarkで不正に最適化しているかを検証するため、7つのfrontier modelで1,008枚のSVGを生成し、LLM judgeで採点する実験を実施した。結果は2026年7月に公開された。
Simon Willisonが数年前から毎回のLLMリリース時に使用してきたprompt「ペリカンが自転車に乗るSVGを生成せよ」は、AIコミュニティで最も有名な非公式benchmarkの一つとなっている。この結果はHacker Newsで高い注目を集めており、AI labsがこのbenchmarkに向けてモデルを意図的に最適化(benchmaxxing)している可能性が議論されてきた。
Dylan Castilloはこれを検証するため、8種類の動物×6種類の乗り物=48パターンのpromptを設計。ペリカンと自転車はその一つに過ぎない構成とした。対象モデルはGPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Proの7つ。各promptにつき3サンプルを生成し、合計1,008枚のSVGを収集した。
採点はGPT-5.6 Lunaが動物・乗り物・動作の一貫性をそれぞれ1〜5点で評価。また、Gemini 3.1 Flash-Liteが画像内の認識要素を記録した。
分析の仮説は「benchmark最適化が行われていれば、ペリカン行または自転車列のスコアが他と比べて不自然に高いはず」というもの。しかし目視確認および採点結果の両面において、ペリカン×自転車の組み合わせが他の組み合わせより明確に優れているという証拠は見つからなかった。1,008枚中リトライが必要だったのは11回のみで、モデルの安定性は高かった。詳細なコードはGithubで公開されている。