papero extrae la estructura de un PDF sin modelos de IA y a velocidad de CPU
Lightweight PDF parser with layout, tables, formulas and bounding boxes

papero es un parser de PDF de código abierto que recupera el orden de lectura, tablas, fórmulas en LaTeX y bounding boxes usando solo geometría y PDFium, sin modelos de machine learning. Procesa 54 papers de arXiv sin fallos a 39 ms por página en una CPU de portátil, y funciona en el navegador, en Python o como API REST.
ML-based tools still win on very irregular layouts and complex math (stacked fractions, matrices) — papero gives you the formula as approximate LaTeX and as an image so nothing is lost.