DuckDB, 오픈소스 데이터 레이크하우스 'DuckLake' 공개
원제: DuckDB Ducklake
왜 중요한가
복잡한 인프라 없이 레이크하우스를 구현할 수 있어, 중소 규모 데이터 팀의 진입 장벽을 낮추고 Iceberg 생태계에 직접적인 경쟁 구도를 형성한다.
DuckDB 팀이 GitHub에 'DuckLake' 프로젝트를 공개했다. DuckDB를 기반으로 한 오픈소스 데이터 레이크하우스 포맷으로, 별도의 메타데이터 서버 없이 SQL만으로 테이블 관리와 트랜잭션을 지원한다.
DuckDB 개발팀이 공식 GitHub 저장소를 통해 'DuckLake'를 공개했다. DuckLake는 DuckDB를 메타데이터 카탈로그로 활용하는 데이터 레이크하우스 포맷이다. Apache Iceberg나 Delta Lake처럼 대규모 분산 인프라 없이도 레이크하우스 기능을 구현하는 것이 핵심 목표다.
DuckLake는 메타데이터를 DuckDB 데이터베이스 파일 또는 PostgreSQL 등 SQL 호환 데이터베이스에 저장한다. 실제 데이터 파일은 로컬 디스크나 S3, GCS 같은 오브젝트 스토리지에 Parquet 형식으로 보관된다. 이를 통해 별도의 카탈로그 서버나 복잡한 메타스토어 설정 없이 ACID 트랜잭션, 타임트래블, 스키마 진화 등의 기능을 제공한다.
기존 Iceberg 포맷이 JSON·Avro 기반 메타데이터 파일을 오브젝트 스토리지에 분산 저장해 작은 파일 문제나 리스팅 오버헤드를 유발하는 반면, DuckLake는 SQL 데이터베이스의 트랜잭션 능력을 직접 활용해 이 문제를 구조적으로 회피한다. 로컬 분석 환경부터 클라우드 스케일 파이프라인까지 단일 포맷으로 대응할 수 있다는 점이 특징이다.
프로젝트는 Apache 2.0 라이선스로 공개됐으며, DuckDB Extension 형태로 설치해 바로 사용할 수 있다.