DuckDB v2.0、サーバーモードとVARIANT型で大幅進化
A Preview of DuckDB v2.0
DuckDB v2.0「Cyanoptera」が今秋リリース予定。新SQLパーサー、新ストレージフォーマット、非同期I/O、トリガー、VARIANT型の強化など、多数の新機能を搭載。特に、DuckDBをサーバーとして使える「quack」拡張とCONNECT文、再帰CTEの大幅高速化(最大40倍)が注目。
DuckDB v2.0は、同じ再帰クエリで約40倍高速です(!)。
HNでの議論
125- otter-in-a-suit
Quackにはとても興奮しています(名前のせいも少しあります)。私はDuckDBを分析とランタイムの両方で使っていますが、実効的なランタイム成果物として巨大な数GiBのDuckDBファイルを提供・処理・管理しなければならないのです[1]。これが完璧なデータベースではないことは承知していますが、高速で、空間サポートがあり、まともなコーディングインターフェースを持ち、dbtとの統合が素晴らしく、数百ステップの巨大なdbtパイプラインの実行から、そのパイプラインの出力のクエリ、ディスク上のCSVの読み取り・クエリまで、まったく同じツールでできるという組み合わせがとても素晴らしいのです。この資産を従来のデータベースのように中央管理できれば、とても嬉しいです。
データパイプラインの各ステップに別々のデータベースを使うことで部分的に解決しており、Clickhouseを完全な代替として試したこともありますが、DuckDBのあまりに多くの点が気に入っているため、置き換えることはできません。
[1]: 興味があれば: https://skaldmaps.com/blog/2026/07/zip-codes-are-a-bad-spati...
- jtbaker
DuckDBは長い間で最も興奮しているものの一つです。2023年から3社のプロジェクトに導入し、リソース要件を大幅に削減し、さまざまな環境で実行してきました。低スペックのコンシューマ向けハードウェアで、メモリを超えるデータをアウトオブコアで処理できるというのは驚くべきことです。
チームの皆さん、ありがとうございます!
- srameshc
DuckDBが大好きです。ストレージ、データ処理、統合、そして今ではグラフまで、私の頼りになるツールの一つになりました。何よりも、これほどポータブルなので使っていて楽しいのです。v2を楽しみにしています。
- therealdrag0
言いにくいのですが、6ヶ月足らずで1万コミットは多いですね。AIが大きな貢献をしているのでしょうか?
愛されているツールであるDuckDBの開発加速にAIを使うことは、懐疑論者を静めるのに十分なのでしょうか?
- gw32
> VARIANT型はDuckDB v1.5で搭載され、その考え方はJSONにステロイドを注入したものです。基本的に、JSONが高速になったと想像してください。[...] DuckDBは半構造化データに隠された共通構造を自動的に検出し、「シュレッド」するため、ストレージでうまく圧縮されます。
これがv2.0で登場するのを本当に楽しみにしています。圧縮されていないJSONは我慢できません。スペース効率が悪すぎます。しかし、Parquetファイル内の異種JSONは、スキーマの違いによりフィールドが静かにドロップされるため、非常に厄介です。DuckDBがこれを解決してくれるのは、まさに私が探していたものです。
- c9cf35860db4
この1年のDuckDBの強化は、プロセス内実行エンジン(それは驚異的です)から、クラウドデータウェアハウスの基盤として機能できるエンジンへの移行のように感じられます。創業者たちはそれを構築したくないと躊躇していたのは知っていますが、それは進行中だという気がします。
- remywang
DuckDBが好きなら、DB研究への資金提供を検討してください[1]!
- dm03514
<3 duckdb。DuckDBの上に構築した(そこそこ人気のある)ストリーム処理エンジンを使って、リアルタイム分析パイプラインを実行しています。DuckDBがデフォルトで提供するパフォーマンスを楽しみにしています!
https://github.com/turbolytics/sql-flow
DuckDBは(Pythonで)構築するのに素晴らしいエンジンであり、毎日、何千ものイベントを問題なく処理し続けています。