Opus 5はなぜ使いにくいのか?

원제: Why does Opus 5 feel worse to work with?

왜 중요한가

벤치마크 최적화가 실제 에이전트 사용성 저하로 이어질 수 있다는 구조적 문제를 제기하며, AI 모델 평가 방식에 대한 논의를 촉발한다.

개발자 Mun Logadan이 2026년 8월 14일, Claude Opus 5는 벤치마크 성능에서 Opus 4.7·4.8·Fable을 능가하지만, 실제 코딩 에이전트 용도에서는 이전 모델들이 더 작업하기 편하다는 견해를 개인 블로그에 공개했다. 이전 모델들은 의도가 불분명할 경우 질문하거나 확인을 구하는 반면, Opus 5는 가정을 세우고 독자적으로 처리를 진행하는 경향이 있다고 분석했다.

개발자 Mun Logadan은 2026년 8월 14일 게재한 블로그 포스트에서, Claude Opus 5가 벤치마크상으로는 Opus 4.7, Opus 4.8, Fable보다 우수한 성능을 보임에도 불구하고, 실제 코딩 작업에서의 사용 경험은 오히려 이전 모델들이 더 뛰어나다고 주장했다. 이전 모델들은 사용자의 의도가 불명확할 때 질문하거나 계획 변경 전 확인을 구하는 반면, Opus 5는 가정을 바탕으로 독자 판단을 내려 지속적인 감독이 필요하다는 것이다. 저자는 이 현상의 원인으로 두 가지 요인을 지목했다. 첫째는 AGI·ASI를 향한 자기 개선형 AI 개발 압력이며, 둘째는 벤치마크 고득점에 대한 경쟁 압력이다. 벤치마크 과제는 자기 완결적이고 정답이 존재하는 구조로 설계되어 있어, 모델이 모호한 상황에서도 과감하게 가정을 세우고 진행하는 경향을 강화한다고 설명했다. 그 결과, 확인이나 명료화를 요청하는 특성은 오히려 낮은 점수로 이어진다. 저자는 실제 코딩 업무에서는 맥락, 비즈니스 요건, 예산 제약 등을 에이전트에게 완전히 전달하는 것이 사실상 불가능하므로, 모호한 상황에서 에이전트가 스스로 판단을 내리는 것은 바람직하지 않다고 강조했다. 이 포스트는 특정 수치나 공식 측정값을 포함하지 않으며, 저자 본인과 동료들의 주관적 사용 경험에 기반한 것임을 명기하고 있다.

출처

mun-logadan.github.io — 원문 읽기 →