LensVLM: выборочное расширение контекста для сжатого визуального представления текста
LensVLM-9B by Apple
Vision-Language Models (VLMs) могут обрабатывать текст как отрендеренные изображения, что позволяет избежать токенизации длинных последовательностей. Однако точность быстро падает при увеличении сжатия, так как символы становятся неразличимыми для vision-энкодера. Для решения этой проблемы предложен LensVLM — фреймворк для инференса и пост-обучения, который позволяет VLMs сканировать сжатые изображения, а затем выборочно расширять только релевантные части до несжатого вида с помощью обученных инструментов. На основе Qwen3.5-9B-Base LensVLM сохраняет точность, сравнимую с верхней границей полного текста, при 4.3-кратном эффективном сжатии и превосходит baselines на основе retrieval, текстового и визуального сжатия вплоть до 10.1-кратного сжатия на семи бенчмарках text QA. LensVLM также обобщается на задачи понимания мультимодальных документов и кода, причём преимущество в точности растёт с увеличением сжатия. Анализ подтверждает подход: обучение делает визуальное сжатие устойчивым к выбору рендеринга, а при росте сжатия модель всё больше полагается на расширенный контент, а не на ненадёжное визуальное чтение. Также даны практические рекомендации по выбору инструментов: для отрендеренного текста предпочтительно текстовое расширение, а для нативных документов, где макет несёт важную информацию, — расширение изображений с высоким разрешением.
LensVLM сохраняет точность, сравнимую с верхней границей полного текста, при 4.3-кратном эффективном сжатии и превосходит baselines на основе retrieval, текстового и визуального сжатия вплоть до 10.1-кратного эффективного сжатия на семи бенчмарках text QA.