papero, ML 모델 없이 PDF 구조를 추출하다
Lightweight PDF parser with layout, tables, formulas and bounding boxes

papero는 PDF에서 읽기 순서, 표, 수식, 그림, 블록 위치를 뽑아내는 경량 오픈소스 도구다. ML 모델이나 GPU 없이 CPU만으로 동작하며, 브라우저, Python, API 어디서든 실행된다. arXiv 논문 54편에서 실패 없이 페이지당 중간값 39ms를 기록했고, LaTeX 수식과 바운딩 박스까지 제공한다.
ML 기반 도구는 매우 불규칙한 레이아웃과 복잡한 수식(겹친 분수, 행렬)에서 여전히 우세하다 — papero는 수식을 근사 LaTeX와 이미지로 함께 제공해 아무것도 잃지 않는다.