DuckDB 2.0 Lebih Cepat: Rahasia Async I/O
Judul asli: Why DuckDB 2.0 is faster
Mengapa Ini Penting
Percepatan 2,5x tanpa ubah query membuat DuckDB makin relevan untuk pipeline data skala besar.
DuckDB 2.0 alpha hadir dengan fitur async I/O yang memangkas waktu query S3 dari 18,8 detik menjadi 7,7 detik pada file Parquet 2,2 GB berisi 228 juta baris.
DuckDB 2.0 dijadwalkan rilis musim gugur 2026, dan versi alpha-nya sudah bisa diuji. Mehdi Ouazza dari MotherDuck mencoba sejumlah fitur baru langsung dari laptop M5-nya, termasuk query ke file Parquet 2,2 GB di AWS S3 (data Stack Overflow votes, 228 juta baris, 2.268 row groups).
Hasilnya mencolok: DuckDB 1.5.5 membutuhkan 18,8 detik, sementara DuckDB 2.0 alpha hanya 7,7 detik — hampir 2,5 kali lebih cepat, hanya dengan membaca satu kolom dari empat kolom yang ada (sekitar 230 MB).
Kunci percepatannya ada di arsitektur async I/O. Pada versi lama, setiap worker melakukan download lalu menunggu, baru decode — CPU idle saat menunggu jaringan. Di versi 2.0, ada pool thread tersendiri khusus untuk download, sehingga puluhan row groups bisa diunduh sekaligus dan langsung tersedia di buffer. Worker hanya bertugas decode, jaringan dan CPU bekerja bersamaan tanpa saling menunggu. Tidak ada perubahan pada sintaks query — efisiensi langsung didapat tanpa modifikasi kode.