DuckLake:DuckDB 的开源 Lakehouse 新格式
DuckDB Ducklake
DuckDB 推出了全新的 DuckLake 扩展,这是一个基于 SQL 和 Parquet 构建的开源 Lakehouse 格式。它巧妙地将元数据存储在 catalog database 中,而实际数据则以 Parquet 文件形式保存。通过 DuckLake,用户可以直接利用标准 SQL 在 DuckDB 中进行数据的读写、更新、时间旅行查询以及 Schema 演化等操作。无论是通过简单的 INSTALL 命令安装,还是构建自定义扩展,DuckLake 都展现了极高的灵活性和易用性,让数据湖的管理变得像操作传统数据库一样简单高效。
DuckLake 是一个构建在 SQL 和 Parquet 之上的开源 Lakehouse 格式。
HN 评论区
14- smithclay
很多人可能不知道或不理解,DuckLake 其实并不依赖 DuckDB:它只是一个能在 DuckDB 中运行的(优秀的)数据湖规范。
目前有一个很酷的 Rust/DataFusion 生态替代方案正在推进,见 https://github.com/datafusion-contrib/datafusion-ducklake,而且 Quack 协议也开启了很多有趣的可能性。
如果你想知道 DuckLake 能用来做什么:建议把所有 agent traces 都丢进去。
- celias
Motherduck 在其 DuckLake 网页上提供了一本 O'Reilly 出版的《DuckLake: The Definitive Guide》书的免费副本
- engineeringwoke
还可以吧,毕竟还是 alpha 阶段的软件。在 v1.5.4 版本中,据我所知 catalog 的过滤计数功能是坏的。我去 main/v2 分支想修复它,结果 DuckDB v2 的 SQL 解析器慢了 10 倍,这又让事情雪上加霜。老实说,这过程挺让人头疼的。