Apple представила LensVLM: сжатие длинного контекста в изображения с выборочным восстановлением

LensVLM: Compressing long context as images, expanding only relevant pages

Apple представила LensVLM: сжатие длинного контекста в изображения с выборочным восстановлением

Apple выпустила LensVLM-9B — 9-миллиардную vision-language модель, которая сжимает длинные тексты в изображения и при необходимости выборочно разворачивает только нужные страницы через обученные инструменты. Модель поддерживает степень сжатия 5x, 10x и 15x, доступна на Hugging Face и распространяется по лицензии Apple Machine Learning Research Model License. Код и демо опубликованы на GitHub.

LensVLM — это 9B Vision Language Model (VLM), которая сканирует сжатые изображения текста, а затем выборочно разворачивает только релевантные страницы в несжатый вид с помощью обученных инструментов.

Ещё за этот день

2026-09-23