Opus 5はなぜ使いにくいのか?

Original : Why does Opus 5 feel worse to work with?

Pourquoi c'est important

Ce débat soulève la tension croissante entre performance benchmark et utilisabilité réelle des agents IA.

Un développeur estime qu'Anthropic Claude Opus 5, bien que plus performant sur les benchmarks qu'Opus 4.7 et 4.8, est moins agréable à utiliser en pratique. Il reproche au modèle de faire des suppositions sans vérifier l'intention de l'utilisateur, contrairement aux versions précédentes.

Selon un billet publié le 14 août 2026, Opus 5 surpasse ses prédécesseurs sur les benchmarks, mais serait moins pratique pour le développement réel. L'auteur, qui cite également des collègues, indique que les modèles Opus 4.7, Opus 4.8 et Fable posent des questions lorsqu'une intention est ambiguë, évitent les suppositions non vérifiées, et ne réinterprètent pas les plans sans accord préalable. Opus 5, en revanche, nécessite une supervision constante (« babysitting »).

L'auteur formule une hypothèse : la pression à performer sur les benchmarks pousserait les labs frontier comme Anthropic à entraîner des modèles capables de prendre des décisions audacieuses face à l'ambiguïté. Or, les benchmarks bien conçus sont auto-suffisants et ne nécessitent pas de clarification — contrairement aux tâches réelles de développement logiciel, où le contexte métier, les contraintes budgétaires et les intentions restent souvent implicites. Sélectionner pour les benchmarks pénaliserait donc les modèles qui s'arrêtent pour demander des précisions, qualité pourtant essentielle pour un agent de codage en production.

Source

mun-logadan.github.io — Lire l'original →