Claude Opus 5 évalué sur SlopCodeBench

Original : Benchmarking Opus 5 on SlopCodeBench

Pourquoi c'est important

Un benchmark ciblant la qualité réelle du code marque une avancée pour l'évaluation des agents IA de développement.

Le modèle Claude Opus 5 d'Anthropic a été testé sur SlopCodeBench, un benchmark de codage à long horizon créé en mars 2026 par le laboratoire de G. Orlanski à l'UW Madison, conçu pour mesurer la qualité réelle du code généré par les agents IA.

SlopCodeBench est un benchmark apparu en mars 2026, développé par le laboratoire de l'Université du Wisconsin-Madison, qui vise à combler un manque identifié dans l'évaluation des modèles de code : la capacité à maintenir la qualité d'une base de code sur le long terme. Contrairement aux benchmarks traditionnels, il s'attaque aux problèmes de « slop » (code de mauvaise qualité, redondant ou mal structuré) que les grands modèles de langage tendent à produire. L'article publié sur GitHub par le projet humanlayer/advanced-context-engineering-for-coding-agents présente une analyse des résultats d'Opus 5 sur ce benchmark, dans un dépôt comptant déjà 2 100 étoiles et 154 forks. L'auteur souligne que ce benchmark répond à une lacune longtemps ignorée : aucun outil fiable n'existait auparavant pour évaluer la capacité d'un modèle à produire un code propre et maintenable à grande échelle.

Source

github.com — Lire l'original →