Amazon दुर्लभ पुस्तकें नष्ट कर AI को प्रशिक्षित कर रहा है
मूल शीर्षक: Amazon, which started off selling books, is destroying rare texts to train AI
यह क्यों महत्वपूर्ण है
AI प्रशिक्षण के लिए दुर्लभ सांस्कृतिक धरोहर को नष्ट करने की प्रक्रिया कॉपीराइट और नैतिकता पर नए सवाल खड़े करती है।
Amazon दुर्लभ और पुरानी पुस्तकें खरीदकर उनकी जिल्द काटकर स्कैन कर रहा है और उस डेटा का उपयोग AI मॉडल के प्रशिक्षण के लिए कर रहा है। यह जानकारी 404 Media की जांच में सामने आई, जिसमें एक दुर्लभ पुस्तक में ट्रैकिंग डिवाइस लगाकर Las Vegas स्थित Amazon की सुविधा VGT3 तक उसे ट्रेस किया गया।
404 Media की रिपोर्ट के अनुसार, Amazon बड़ी मात्रा में दुर्लभ पुस्तकें खरीद रहा है, उनकी जिल्द (spine) काट रहा है और उन्हें स्कैन करके AI प्रशिक्षण डेटा के रूप में उपयोग कर रहा है। इस जांच में एक दुर्लभ पुस्तक में ट्रैकिंग डिवाइस छुपाया गया, जो अंततः Las Vegas स्थित Amazon की सुविधा VGT3 में पहुंचा। यह सुविधा एक डायनासोर के प्रतीक चिन्ह से पहचानी जाती है जो अपने पंजों में एक किताब थामे हुए है।
Amazon ने 404 Media को दिए बयान में कहा कि वह "ग्राहकों के लिए उत्पादों और सेवाओं को बेहतर बनाने के लिए वाणिज्यिक माध्यमों से पुस्तकें खरीदता है।"
Amazon जैसी कंपनियों को LLM (Large Language Models) के प्रशिक्षण के लिए अत्यंत विशाल मात्रा में टेक्स्ट डेटा की आवश्यकता होती है। इंटरनेट पर उपलब्ध डेटा पहले ही काफी हद तक उपयोग किया जा चुका है। ऐसे में दुर्लभ और आउट-ऑफ-प्रिंट पुस्तकें नए और मूल्यवान प्रशिक्षण डेटा का स्रोत बन रही हैं।
विशेषज्ञों के अनुसार, 2022 से पहले प्रकाशित पुस्तकें विशेष रूप से मूल्यवान हैं क्योंकि यह सामग्री किसी AI द्वारा नहीं लिखी गई हो सकती। जब LLM AI-जनित टेक्स्ट पर प्रशिक्षण लेते हैं, तो "model collapse" का खतरा होता है — यानी अत्यधिक AI-जनित सामग्री के अंतर्ग्रहण से मॉडल की आउटपुट गुणवत्ता में गिरावट आ सकती है।
उल्लेखनीय है कि Anthropic पर पहले से ही पुस्तकों की अवैध पायरेसी के आरोप हैं। AI प्रशिक्षण के लिए दुर्लभ पुस्तकों को भौतिक रूप से नष्ट करने की यह प्रक्रिया नई नैतिक और कानूनी चिंताओं को जन्म दे रही है।