Opus 5をSlopCodeBenchで評価した結果

원제: Benchmarking Opus 5 on SlopCodeBench

왜 중요한가

大規模コードベース品質維持能力の評価基準確立は、実用的なコーディングエージェント選定において業界全体に影響する重要課題である。

HumanLayerのGitHubリポジトリが2026年3月に登場した長期コーディングベンチマーク「SlopCodeBench」を用いてClaude Opus 5の性能を評価した結果を公開した。同ベンチマークはウィスコンシン大学マディソン校のGOrlanski研究室が開発し、既存のコーディングベンチマークが大規模コードベースの品質維持能力を測定できていない問題に対応している。

HumanLayerが公開したレポートでは、ウィスコンシン大学マディソン校のGOrlanski研究室が2026年3月に発表した「SlopCodeBench」を使い、Claude Opus 5のコーディング性能を評価した内容が詳述されている。

SlopCodeBenchは「長期水平型(long-horizon)」コーディングベンチマークと位置付けられており、既存のベンチマークが抱える課題——すなわち、モデルがコードベースの品質を維持する能力を適切に測定できていない点——に取り組んでいる。従来のベンチマークは比較的小規模・短期タスクに偏りがちで、実際の開発現場で求められる大規模コードベースへの継続的な改変や品質管理を反映しにくいとされてきた。

本リポジトリはコーディングエージェント向けの高度なコンテキストエンジニアリング手法を探求するプロジェクトであり、2,100件以上のStarを獲得している。公開レポートは288行・約23.6KBの分量で、Opus 5の評価結果の詳細とともに、長期コーディングタスクに対する文脈設計のアプローチが記述されている。なお、具体的なスコアや数値比較の詳細は原文に記載されているが、本情報源のプレビュー範囲では数値の全容は確認できていない。

출처

github.com — 원문 읽기 →