Opus 5 का SlopCodeBench पर बेंचमार्क परिणाम

मूल शीर्षक: Benchmarking Opus 5 on SlopCodeBench

यह क्यों महत्वपूर्ण है

कोडिंग AI मॉडलों की दीर्घकालिक कोडबेस गुणवत्ता मापने के लिए नए बेंचमार्क मानक स्थापित होने से उद्योग में मूल्यांकन पद्धति में सुधार होगा।

humanlayer के शोधकर्ताओं ने Claude Opus 5 मॉडल को UW Madison के @GOrlanski लैब द्वारा मार्च 2026 में जारी किए गए SlopCodeBench बेंचमार्क पर परीक्षण किया। यह बेंचमार्क कोडबेस की दीर्घकालिक गुणवत्ता को मापने के लिए डिज़ाइन किया गया है।

humanlayer के advanced-context-engineering-for-coding-agents प्रोजेक्ट के अंतर्गत एक शोध दस्तावेज़ प्रकाशित किया गया है, जिसमें Claude Opus 5 को SlopCodeBench पर बेंचमार्क किया गया है। SlopCodeBench एक नया लॉन्ग-होराइज़न कोडिंग बेंचमार्क है, जिसे UW Madison के @GOrlanski लैब ने मार्च 2026 में जारी किया था।

शोधकर्ता ने बताया कि मौजूदा कोडिंग बेंचमार्क की एक बड़ी समस्या यह है कि वे कोडबेस की गुणवत्ता को लंबे समय तक बनाए रखने की मॉडल की क्षमता को सही तरीके से नहीं मापते। SlopCodeBench इसी कमी को दूर करने का प्रयास करता है, क्योंकि यह लंबी-अवधि के कोडिंग कार्यों पर मॉडल के प्रदर्शन का मूल्यांकन करता है।

यह दस्तावेज़ GitHub पर 2,100 से अधिक Stars और 154 Forks के साथ काफी चर्चा में है। दस्तावेज़ में 288 लाइनें और 23.6 KB की जानकारी शामिल है, जो Opus 5 के परीक्षण परिणामों और context engineering तकनीकों का विस्तृत विवरण देती है। पूर्ण बेंचमार्क परिणाम और विश्लेषण मूल दस्तावेज़ में उपलब्ध हैं।

स्रोत

github.com — मूल लेख पढ़ें →