Apple lanza LensVLM: comprime texto como imágenes y expande solo las páginas relevantes
LensVLM: Compressing long context as images, expanding only relevant pages
Apple presenta LensVLM-9B, un modelo de visión-lenguaje que aborda el contexto largo comprimiendo el texto en imágenes y expandiendo selectivamente solo las páginas relevantes mediante herramientas aprendidas. Con compresión de hasta 15x, el modelo escanea las versiones comprimidas y recupera la información necesaria para responder preguntas. Está disponible en Hugging Face y el código en GitHub.
LensVLM es un modelo de visión-lenguaje de 9B que escanea imágenes comprimidas de texto y luego expande selectivamente solo las páginas relevantes a su forma sin comprimir mediante herramientas aprendidas.