DataHaskell реализовала запись Parquet-файлов на Haskell

Writing Parquet files using Haskell

В библиотеке DataHaskell/Dataframe появилась функция writeParquet, которая записывает датафрейм в Parquet с разумными настройками по умолчанию. Для тонкой настройки предусмотрена writeParquetWithOptions с параметрами pageSize, rowGroupSize, batchRows, subBatchRows, compressionCodec и стратегией записи. Авторы объясняют структуру Parquet, компромиссы при реализации и детали работы с памятью через MutableByteArray.

Долгое время наши возможности сериализации данных в Haskell сводились к CSV, JSON или простому дампу в ByteString.

Ещё за этот день

2026-09-25