DuckDB 2.0:S3查询提速3倍的秘密
Why DuckDB 2.0 is faster

DuckDB 2.0 即将发布,我亲测了其在 M5 笔记本和 S3 上的表现。最惊喜的是异步 I/O 的引入:无需修改任何查询,S3 上的 Parquet 文件读取速度直接提升 2 到 3 倍。这得益于独立的下载线程池,让网络传输与 CPU 计算真正并行。此外,递归 CTE 引擎的重写让处理 Git 历史等深层父子关系查询从秒级降至毫秒级。VARIANT 类型也通过“ shredding”技术,将结构化 JSON 拆分为列式存储,体积缩小 2.7 倍且查询快 6 倍。这些改进让 DuckDB 在处理复杂数据模型时更加游刃有余。
如果处理深层的父子关系链,2.0 能将原本需要交给图数据库的任务,变成一次普通的查询。