Opus 5をSlopCodeBenchで評価した結果

原題: Benchmarking Opus 5 on SlopCodeBench

なぜ重要か

コードベース品質の長期維持という実用的観点でAIモデルを評価するベンチマークの普及は、コーディングエージェントの実運用基準の確立につながる。

HumanLayerのリポジトリにて、Anthropicの「Claude Opus 5」をコーディングエージェント向けベンチマーク「SlopCodeBench」で評価した結果が公開された。SlopCodeBenchはUW Madison・Gal Orlanski氏の研究室が2026年3月に公開した長時間タスク対応のコーディングベンチマークで、コードベースの品質維持能力を測定する点で既存ベンチマークの課題を補う設計となっている。

GitHubリポジトリ「advanced-context-engineering-for-coding-agents」(HumanLayer)に、Claude Opus 5をSlopCodeBenchで評価したレポートが掲載された。

SlopCodeBenchは、ウィスコンシン大学マディソン校のGal Orlanski氏らの研究室が2026年3月に公開した、長時間タスク(long-horizon)向けのコーディングベンチマークである。既存のコーディングベンチマークの多くは、モデルがコードベースの品質を長期にわたって維持できるかを十分に評価できていないという課題があった。SlopCodeBenchはその課題に直接対応した設計が特徴とされている。

レポートの著者は「コーディングエージェントがコードベース品質を維持する能力を測定する優れたベンチマークが存在しない」と従来述べてきたが、SlopCodeBenchの発見によりその認識を修正したと記している。

レポートはGitHub上で全288行・23.6KBにわたり公開されており、具体的なベンチマーク手法や評価結果の詳細が記載されている。リポジトリ自体はStar数2,100超・Fork数154を記録しており、コーディングエージェント向けのコンテキストエンジニアリング手法に関心を持つ開発者コミュニティから注目を集めている。

出典

github.com — 元記事を読む →