DuckDB v2.0が非同期I/Oをサポート、S3クエリを高速化

Judul asli: Asynchronous I/O in DuckDB: Work, Thread, Work

Mengapa Ini Penting

クラウド上のデータレイク活用が拡大する中、DuckDBのリモートI/O性能向上は実運用における競争力強化につながる。

DuckDBは2026年秋リリース予定のv2.0から、ParquetとCSVファイルの非同期読み込みをサポート。EC2/S3環境でのリモートクエリ性能を大幅に改善する。

DuckDBの開発チームは2026年7月31日、バージョン2.0(2026年秋リリース予定)から非同期I/Oパイプラインをサポートすると発表した。対象はParquetファイルおよびシーク可能なUTF-8形式のCSVファイルで、DuckDBネイティブ形式やJSONへの対応も今後予定されている。

従来のDuckDBはローカルSSDへの同期I/Oを前提として設計されており、フィルタやプロジェクションのプッシュダウンにより不要なデータ読み込みを削減することで性能を確保していた。しかし近年、S3などのBlobストレージに保存されたデータをEC2上で処理するデータレイク構成での利用が増加。同期I/Oではワーカースレッドがリモート読み込み完了まで待機状態となり、帯域幅を十分に活用できない問題が顕在化していた。

非同期I/Oの導入により、I/O操作中もワーカースレッドがデータのデコードや集計などの処理を継続できるようになる。現在はv2.0.0-devのプレビュービルドで試用可能で、正式リリース時にはデフォルト有効となる。

Sumber

duckdb.org — Baca artikel asli →