Opus 5、SlopCodeBenchで性能評価実施

Judul asli: Benchmarking Opus 5 on SlopCodeBench

Mengapa Ini Penting

コードベース品質維持に特化したベンチマークの登場は、AIコーディング評価手法の進化を示す重要な指標となる。

HumanLayerがClaude Opus 5をSlopCodeBenchでベンチマーク。2026年3月にUW Madisonが公開した長期コーディング評価基準で、コードベース品質維持能力を測定した。

HumanLayerのリポジトリ「advanced-context-engineering-for-coding-agents」において、Claude Opus 5をSlopCodeBenchで評価した結果が公開された。SlopCodeBenchは2026年3月にUW Madison(ウィスコンシン大学マディソン校)の@GOrlanski研究室が開発した長期水平コーディングベンチマークで、既存のコーディングベンチマークが抱える問題点、すなわちモデルがコードベースの品質を維持する能力を十分に測定できないという課題に対応している。著者はかつて「コードベース品質維持能力に関する良いベンチマークが存在しない」と述べていたが、SlopCodeBenchの登場によりその認識を修正した。本レポートは288行・23.6KBの詳細な分析文書として公開されており、コーディングエージェントのコンテキストエンジニアリングに関する研究の一環として位置づけられている。リポジトリは現時点でスター2,100以上、フォーク154を獲得している。

Sumber

github.com — Baca artikel asli →