AIラボはペリカンベンチマークで不正をしているか?
Judul asli: Are AI Labs Pelicanmaxxing?
Mengapa Ini Penting
ベンチマーク不正の有無を定量的に検証する手法として、AI評価の透明性向上に貢献する事例。
研究者Dylan Castilloが7つのフロンティアモデルで1,008枚のSVGを生成し、AIラボがSimon Willisonの「ペリカン自転車」非公式ベンチマークに特化した訓練をしているか検証した。
Simon Willisonが数年前から実施している「ペリカンが自転車に乗るSVGを生成せよ」というプロンプトは、AI業界で最も有名な非公式ベンチマークの一つとなっている。この結果はHacker Newsで高い注目を集めており、AIラボがこのベンチマーク向けにモデルを特化訓練する「pelicanmaxxing」の可能性が議論されていた。
Dylan Castilloは検証のため、8種の動物×6種の乗り物=48プロンプトのグリッドを構築。GPT-5.6 Terra、Claude Sonnet 5、Gemini 3.5 Flash、Grok 4.5、Qwen3.7-Max、GLM-5.2、DeepSeek V4 Proの7モデルで各プロンプト3サンプルを生成し、計1,008枚のSVGを作成した。
各画像はGPT-5.6 Lunaが動物・乗り物・動作の一貫性を1〜5点で採点。ペリカン行または自転車列が他より突出して高いスコアを示せば、ベンチマーク特化訓練の証拠となる。しかし目視確認の段階では、ペリカン+自転車の画像が他の組み合わせより明らかに優れているケースは確認されなかった。コードはGitHubで公開されている。