MLモデル不要、ブラウザで動く軽量PDFパーサー「papero」が登場
Lightweight PDF parser with layout, tables, formulas and bounding boxes

paperoは、レイアウト・表・数式・バウンディングボックスを抽出するオープンソースのPDFパーサーだ。MLモデルを使わずCPUのみで動作し、ブラウザ、Python、APIとして利用できる。多段組の読み順、罫線なし表、LaTeX数式を再構築し、各ブロックの位置情報も保持。arXiv論文54件で失敗ゼロ、中央値39ms/ページという高速処理を実現している。
MLベースのツールは非常に不規則なレイアウトや複雑な数式(積み重ね分数、行列)では依然として優位だが、paperoは数式を近似LaTeXと画像の両方で提供するため、情報が失われることはない。