LensVLM-9B de Apple
LensVLM-9B by Apple
Los Vision-Language Models (VLMs) pueden procesar texto como imágenes renderizadas, evitando la tokenización de secuencias largas. Sin embargo, la precisión se degrada rápidamente al aumentar la compresión, ya que los caracteres se vuelven indistinguibles. LensVLM, un framework de inferencia y receta de post-entrenamiento basado en Qwen3.5-9B-Base, permite a los VLMs escanear imágenes comprimidas y expandir selectivamente solo las partes relevantes a su forma sin comprimir mediante herramientas aprendidas. Mantiene una precisión comparable al límite superior de texto completo con una compresión efectiva de 4.3x y supera a las líneas base de recuperación, compresión de texto y visual hasta 10.1x en siete benchmarks de text QA. Además, generaliza a tareas multimodales de documentos y comprensión de código, con ganancias crecientes a mayor compresión. El análisis valida que el entrenamiento hace robusta la compresión visual a las elecciones de renderizado y que, a mayor compresión, el modelo depende más del contenido expandido que de la lectura visual no confiable. También proporciona guías prácticas: la expansión de texto es preferible para texto renderizado, mientras que la expansión de imágenes de alta resolución es adecuada para documentos nativos cuyas señales de diseño contienen información relevante.
LensVLM mantiene una precisión comparable al límite superior de texto completo con una compresión efectiva de 4.3x y supera a las líneas base de recuperación, compresión de texto y visual hasta 10.1x de compresión efectiva en siete benchmarks de text QA.