Papero extrahiert PDF-Strukturen ohne ML-Modelle – direkt im Browser
Lightweight PDF parser with layout, tables, formulas and bounding boxes

Papero ist ein neuer Open-Source-PDF-Parser, der Lesereihenfolge, Tabellen, Formeln und Bounding-Boxen allein durch Geometrie rekonstruiert – ganz ohne ML-Modelle oder GPU. Er läuft auf einer Laptop-CPU, im Browser oder als API und liefert Markdown, JSON, Word und Excel. In Benchmarks verarbeitet er 54 dichte arXiv-Paper ohne Fehler in median 39 ms pro Seite, während Docling 82,9 Sekunden pro PDF benötigt.
„ML-basierte Tools gewinnen weiterhin bei sehr unregelmäßigen Layouts und komplexer Mathematik – papero liefert die Formel als ungefähres LaTeX und als Bild, damit nichts verloren geht.“