Haskell bekommt einen Parquet-Writer
Writing Parquet files using Haskell
DataHaskell hat einen Parquet-Writer für die Dataframe-Bibliothek implementiert. Die Funktion writeParquet schreibt Dataframes mit sinnvollen Standardwerten für Row-Group- und Page-Größen; writeParquetWithOptions erlaubt detaillierte Kontrolle über Puffergrößen, Kompression und Dateiaufteilung. Der Artikel erklärt den Aufbau von Parquet-Dateien, die Speicherverwaltung mit gepinnten ByteArrays und die effektvolle Faltung, die den Schreibvorgang antreibt.
Für eine lange Zeit beschränkten sich unsere Möglichkeiten, Daten in Haskell zu serialisieren, auf CSV, JSON oder einfach einen ByteString.