Claude Opus 5.5、知能指数で212モデル中1位
原題: Claude Opus 5.5 Intelligence, Performance and Price Analysis (Max)
なぜ重要か
知能指数1位という結果はAnthropicの技術力を示すが、価格が中央値の約2倍という現実は企業導入時のコスト試算に直接影響する。
Artificial Analysisが2026年9月リリースの「Claude Opus 5.5(Adaptive Reasoning、Max Effort)」を分析。同サイトのIntelligence Indexでスコア58を記録し、212モデル中1位を獲得した。価格は入力100万トークンあたり4ドル、出力同20ドルで、同クラス中央値(入力2ドル・出力10ドル)の約2倍と高めに設定されている。
Artificial Analysisが公開したベンチマーク結果によると、AnthropicのClaude Opus 5.5(Adaptive Reasoning、Max Effort、Default Fallback)はIntelligence Index v4.3.2でスコア58を記録し、212モデル中トップとなった。同インデックスの中央値は25であり、平均を大きく上回る数値だ。
評価対象となったモデルは推論(Reasoning)機能を持つバリアントで、テキストと画像の入力に対応し、出力はテキストのみ。コンテキストウィンドウは100万トークンと広大で、A4用紙換算で約1500ページ分に相当する。
Intelligence Indexの評価には、AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1の計10項目が含まれる。評価に要したトークン数は2億6000万で、中央値8800万と比べて非常に多く、応答が冗長な傾向があることが示された。
一方でコストは課題だ。評価全体にかかった総費用は8708.20ドルに上り、212モデル中コスト効率ランキングは93位にとどまった。Verbosity(出力量)ランキングも95位と中程度で、知能の高さがそのままコストパフォーマンスに直結しないことを示している。速度(出力トークン/秒)については現時点でデータが未公開となっている。
Anthropicは同モデルを2026年9月にリリースしており、プロプライエタリモデルとして提供されている。