RTKのトークン節約主張、実測では別結果
मूल शीर्षक: RTK reports token savings, but our cost benchmarks disagree
यह क्यों महत्वपूर्ण है
AI कोडिंग टूल्स के लागत-दावों की स्वतंत्र जाँच अब ज़रूरी हो गई है — वायरल संख्याएँ और असली बेंचमार्क अक्सर मेल नहीं खाते।
AI कोडिंग टूल RTK (Rust Token Killer) पर Quesma के इंजीनियरों ने $1,500 से अधिक खर्च कर बेंचमार्क किया। Claude Code + Fable 5.0 में कुल लागत 5% घटी, लेकिन OpenCode + DeepSeek V4 Pro 0813 में 5% बढ़ गई। टास्क-स्तर पर DeepSeek की लागत 17% बढ़ी। "60% बचत" के दावे से परिणाम काफी अलग रहे।
RTK (Rust Token Killer) एक टूल है जो AI एजेंट को टर्मिनल आउटपुट पढ़ाने से पहले उसे फ़िल्टर और संपीड़ित करता है। GitHub पर 79,000 से अधिक स्टार के साथ यह AI कोडिंग को सस्ता बनाने के सबसे चर्चित टूल्स में से एक है। X पर एक पोस्ट में दावा किया गया कि RTK Claude Code के टोकन 60% तक घटा सकता है — उस पोस्ट को 3,13,000 व्यूज मिले।
Quesma के Bartosz Kotrys और Jacek Migdal ने इस दावे को परखने के लिए Terminal-Bench 2.1 पर $1,500 से ज़्यादा खर्च कर 1,740 प्रयास किए। प्रत्येक टास्क को RTK के साथ और बिना RTK के 5-5 बार चलाया गया।
नतीजे मिले-जुले रहे। Claude Code (Fable 5.0) के साथ कुल बिल 5% घटा, पर पास रेट भी 84% से 83% हो गई। DeepSeek V4 Pro 0813 (OpenCode) में कुल खर्च 5% बढ़ा और पास रेट 71% से 69% गिरी। टास्क-स्तर के औसत में Fable 1% महंगा और DeepSeek 17% महंगा रहा।
Fable की बचत लगभग पूरी तरह एक ही टास्क — 'winning-avg-corewars' — से आई। RTK के साथ वह टास्क आधे turns में पूरा हुआ। बाकी टास्क में बचत 1% से भी कम थी। DeepSeek के उन 36 टास्क में भी जहाँ सभी 10 प्रयास पास हुए, लागत 18% अधिक रही।
RTK का README खुद स्वीकार करता है: "RTK bash आउटपुट का 90% तक काट सकता है, लेकिन इसका मतलब बिल 90% कम होना नहीं है।" कम टर्मिनल आउटपुट का सीधा मतलब सस्ती AI कोडिंग नहीं है — इससे ज़्यादा turns लग सकते हैं या गुणवत्ता गिर सकती है। JetBrains के SkillsBench ने भी RTK में कोई बचत नहीं पाई थी।