papero extrae la estructura de un PDF sin modelos de IA y a velocidad de CPU

Lightweight PDF parser with layout, tables, formulas and bounding boxes

papero extrae la estructura de un PDF sin modelos de IA y a velocidad de CPU

papero es un parser de PDF de código abierto que recupera el orden de lectura, tablas, fórmulas en LaTeX y bounding boxes usando solo geometría y PDFium, sin modelos de machine learning. Procesa 54 papers de arXiv sin fallos a 39 ms por página en una CPU de portátil, y funciona en el navegador, en Python o como API REST.

ML-based tools still win on very irregular layouts and complex math (stacked fractions, matrices) — papero gives you the formula as approximate LaTeX and as an image so nothing is lost.

Más de este día

2026-10-01