Haskell로 Parquet 파일 쓰기, Dataframe 라이브러리에 구현되다

Writing Parquet files using Haskell

DataHaskell의 Dataframe 라이브러리에 Parquet writer가 추가됐다. writeParquet 함수에 데이터프레임을 넘기면 기본 설정으로 파일이 생성되며, writeParquetWithOptions를 쓰면 페이지 크기, 로우 그룹 크기, 압축 코덱 등을 세밀하게 조정할 수 있다. Parquet는 CSV나 JSON보다 저장 효율과 쿼리 성능이 뛰어나 데이터 과학 생태계에서 사실상 표준으로 자리 잡았지만, Haskell에서는 그동안 지원이 빈약했다. 이 구현은 배치 및 서브배치 단위로 데이터를 처리하고, 고정된 ByteArray 버퍼를 동적으로 확장해 메모리를 관리한다.

Haskell이 데이터 생태계와 상호 운용되려면, 그 생태계에서 사용되는 표준 형식을 이해할 수 있어야 한다.

이 날의 다른 글

2026-09-25