DuckDB v2.0 में Async I/O सपोर्ट आएगा
मूल शीर्षक: Asynchronous I/O in DuckDB: Work, Thread, Work
यह क्यों महत्वपूर्ण है
Remote Data Lake क्वेरी परफॉर्मेंस में यह बदलाव Cloud-Native Analytics के लिए DuckDB को और प्रतिस्पर्धी बनाएगा।
DuckDB ने घोषणा की है कि 2026 की शरद ऋतु में आने वाले v2.0 संस्करण में Parquet और CSV फाइलों के लिए Asynchronous I/O सपोर्ट जोड़ा जाएगा। इससे EC2/S3 जैसे Remote Storage Setup में Query की गति में उल्लेखनीय सुधार होगा।
DuckDB ने अपने आधिकारिक Blog में बताया कि v2.0 (2026 शरद ऋतु में प्रस्तावित) से Parquet और असंपीड़ित UTF-8 CSV फाइलों के लिए Asynchronous I/O Pipeline को Default रूप से सक्षम किया जाएगा।
अब तक DuckDB मुख्यतः Local SSD पर चलता था, जहाँ Synchronous I/O पर्याप्त था। लेकिन अब DuckDB को Remote Data Lakes, जैसे S3 में संग्रहीत डेटा को EC2 मशीनों पर Process करने के लिए भी उपयोग किया जा रहा है। इस Setup में Synchronous I/O के कारण Worker Thread डेटा आने तक Block रहता है, जिससे Network Bandwidth का पूरा उपयोग नहीं हो पाता।
Asynchronous I/O में Thread I/O Request शुरू करने के बाद Block नहीं होता, बल्कि डेटा आने की प्रतीक्षा के दौरान अन्य कार्य जैसे Decoding, Aggregation आदि कर सकता है। Parquet Scan में Row-Group-Based Jobs और Byte-Range Requests का उपयोग होता है।
DuckDB के अनुसार यह सुविधा अभी v2.0.0-dev Preview Build में उपलब्ध है। JSON और DuckDB के Native Format के लिए Async I/O Support भविष्य में आएगा। इस वर्ष मई में DuckDB को Quack Protocol के माध्यम से Server के रूप में भी चलाने की सुविधा दी गई थी।