Opus 5はなぜ使いにくいのか?
मूल शीर्षक: Why does Opus 5 feel worse to work with?
यह क्यों महत्वपूर्ण है
Benchmark-driven training से AI agent की व्यावहारिक उपयोगिता घटने का यह मुद्दा पूरे frontier AI उद्योग के लिए प्रासंगिक है।
Anthropic के Opus 5 मॉडल के साथ काम करना Opus 4.7, Opus 4.8 और Fable की तुलना में कठिन क्यों लगता है, इस पर एक developer ने 2026 अगस्त 14 को अपना अनुभव साझा किया। उनके अनुसार Opus 5 benchmark में आगे होने के बावजूद practical उपयोग में कमज़ोर महसूस होता है।
Developer Mun Logadan ने अपने blog में लिखा कि Opus 5, Opus 4.7, Opus 4.8 और Fable की तुलना में काम करने में कम सुविधाजनक लगता है। हालाँकि वे यह नहीं कह रहे कि Opus 5 की क्षमता कम है — benchmark में यह Fable को भी टक्कर देता है — लेकिन व्यावहारिक उपयोग में यह निराशाजनक रहा।
उनके अनुसार पुराने मॉडल तीन काम करते थे: (1) intent अस्पष्ट होने पर रुककर सवाल पूछना, (2) बिना पूछे assumption न बनाना, (3) बिना confirmation के plan को reinterpret न करना। Opus 5 यह नहीं करता, जिससे उसे लगातार monitor करना पड़ता है।
लेखक का अनुमान है कि इसके पीछे दो कारण हैं। पहला — frontier labs की AGI/ASI की ओर self-improving AI बनाने की चाहत। दूसरा — benchmark scores में शीर्ष स्थान पाने का दबाव।
वे कहते हैं कि अच्छे benchmark tasks स्वतः-पूर्ण होते हैं और ambiguity के बावजूद bold assumption लेने वाले मॉडल को reward करते हैं। इसका दुष्परिणाम यह है कि clarification माँगने की प्रवृत्ति वाले मॉडल को penalize किया जाता है — जबकि coding agent के लिए यही सबसे ज़रूरी गुण है।
वास्तविक कोडिंग में business context, budget constraints और इरादे पूरी तरह लिखकर देना असंभव है। ऐसे में agent का अटककर सवाल पूछना ज़रूरी है, न कि अनुमान लगाकर आगे बढ़ जाना।