HaskellにParquetライターが登場、Dataframeライブラリで大規模データを効率的に保存
Writing Parquet files using Haskell
DataHaskellのDataframeライブラリにParquetライターが実装された。writeParquet関数を使えば、行グループやページサイズの適切なデフォルト値で手軽に書き出せる。より細かい制御が必要な場合はwriteParquetWithOptionsでページサイズや圧縮コーデック、バッチ行数などを指定可能。Parquetの効率的な圧縮とクエリ性能をHaskellエコシステムに取り込む狙いだ。
Parquet形式は、そのシンプルさと引き換えに、保存されたデータの効率的な保存とクエリを実現する。
HNでの議論
18- mugul
丁寧に素晴らしいツールを作っている、かなりクールなコミュニティのようだ。データ変換に関数型言語を使うのはまともなアイデアに思える。まだ触ってはいないが、今度ぜひ試してみたいリストに入ったよ。
ただ、データサイエンスにHaskellを使うのが「速い」と主張しているが、数字を示さない限りそれは何の意味もない。pandasやpolarsとの小さなベンチマークくらいはあっても悪くないだろう。
- jmaker
私は今でもHaskellが大好きで、大学時代には何年も専念していた。でもHaskellで仕事を得るのは不可能だった。Scalaを少しやったが、それは衰退しつつある。F#やOCamlは極めてニッチだ。機会はますます減り、エンジニアリングマネジメントは関数型プログラマーを雇うのは不可能だと確信している。
このAI主導の新しい世界で、関数型プログラミングのような贅沢なものにまだ居場所はあるのだろうか?
つまり、手でコードを書く人はほとんどいなくなり、生成されたコードを読む人も少なく、モデルは関数型言語で訓練されておらず、関数型言語を使うのはトークン効率的に非効率だ。その一方で、多くの人がLLMにプロンプトを送るだけで一夜にして自称ソフトウェアエンジニアになっている。
- Quothling
個人的には、Haskellが https://arrow.apache.org/ の選択肢の一部になるのを見たいが、それでもこれはクールなプロジェクトだ。