Opus 5はなぜ使いにくいのか?開発者の考察
Judul asli: Why does Opus 5 feel worse to work with?
Mengapa Ini Penting
ベンチマーク最適化と実用性のトレードオフはAIエージェント開発全体の課題として注目される
開発者がClaude Opus 5はOpus 4.7やFableより使いにくいと指摘。高性能でもベンチマーク重視の訓練が実用性を損なう可能性を論じた。
あるソフトウェア開発者が2026年8月14日に公開した記事で、Claude Opus 5はOpus 4.7、Opus 4.8、Fableと比較して実際の作業において使いにくいと述べた。ベンチマーク上の能力は向上しているものの、Opus 5はユーザーの意図が不明な場合でも確認せずに仮定を立て、計画を勝手に解釈・変更する傾向があるという。一方、旧モデルは不明点があれば立ち止まって質問し、確認なしに仮定を立てないため、コーディングエージェントとして扱いやすいと評価された。著者はこの現象の原因として、AGI/ASI実現に向けた自己改善AI開発の方向性と、ベンチマーク高得点へのプレッシャーという二つの要因が複合していると推測する。ベンチマークタスクは自己完結型であり、曖昧な状況でも大胆な仮定を立てて正解するモデルが優遇される。しかし実際の開発現場では文脈や制約を完全に明示することは不可能であり、エージェントが必要に応じて確認を求める行動こそが重要だと主張している。