Papero извлекает структуру PDF без ML-моделей и работает прямо в браузере

Lightweight PDF parser with layout, tables, formulas and bounding boxes

Papero извлекает структуру PDF без ML-моделей и работает прямо в браузере

Papero — открытый парсер PDF, который восстанавливает структуру документа на чистом CPU: определяет порядок чтения в многоколоночных статьях, распознаёт таблицы, превращает формулы в LaTeX, сохраняет координаты каждого блока и выгружает результат в Markdown, JSON, Word или Excel. Работает в браузере, через Python или REST API. На 54 научных статьях arXiv — ноль ошибок и 39 мс на страницу.

Getting the text out of a PDF is easy. Getting its structure back — which column comes first, which lines are a table, where the formula is — is what makes the output usable for RAG, search and LLMs.

Ещё за этот день

2026-10-01