AI Intelligence Index v4.2 発表:Anthropic首位
मूल शीर्षक: Artificial Analysis Intelligence Index v4.2
यह क्यों महत्वपूर्ण है
非公開テストセット比率の倍増により、AI評価のgaming対策が強化され、業界標準ベンチマークの信頼性向上に直結する。
Artificial Analysisが2026年9月4日にIntelligence Index v4.2を発表。新評価項目AA-BriefcaseとGDP.pdf(4,592ページのPDF推論)を追加し、非公開テストセットの比重を40%に倍増。Anthropic Claude Fable 5.1が首位、OpenAI GPT-6 Astraが2位。
Artificial Analysisは2026年9月4日、Intelligence Index v4.2を公開した。これはv5の一部要素を前倒しした中間アップデートで、より複雑で実用的なタスクの追加と、ベンチマーク対策(gaming)防止のための非公開テストセット拡充が主な変更点である。
主な追加項目は2つ。「AA-Briefcase」は非公開テストセットを持つ独自評価で、業界専門家が構築した複雑なプロジェクトにおける複数週間にわたる知識業務タスクをモデルに課す。評価は検証可能なタスク達成度、分析品質、プレゼンテーション品質を組み合わせたルーブリック採点とペアワイズ採点で実施される。「GDP.pdf」はSurge AIが作成した評価で、100件のPDF・10分野にわたる4,592ページを対象に、単一ターンでの専門文書推論能力を測定。1,275件の専門家作成基準に基づいて採点される。
Index全体の重み付けでは、非公開テストセットの比率がv4.1の2倍となる40%に引き上げられた。対象はAA-Briefcase、AA-Omniscience、CritPtの解答データで、ラボによる評価対策を抑制する目的がある。v5ではこの比率をさらに高める予定。
ランキングでは、AnthropicのClaude Fable 5.1が首位、OpenAIのGPT-6 Astraが2位(GPT-5.6 Solから4ポイント向上)。Metaが3位、次いでSpaceXAI、Moonshot/Kimi、Z.AI、Googleと続く。コスト効率のPareto最前線はAnthropic、OpenAI、Meta、Z.AIの4社が占める。なお、GPQA Diamondは飽和状態に達したとして削除された。