Apple veröffentlicht LensVLM: 9B-Modell komprimiert Text als Bilder
LensVLM: Compressing long context as images, expanding only relevant pages
Apple hat LensVLM-9B vorgestellt, ein Vision-Language-Modell, das Textdokumente als komprimierte Bilder scannt und nur relevante Seiten über erlernte Tools entpackt. Das 9B-Modell basiert auf Qwen und erreicht Kompressionsraten von 5x, 10x oder 15x. Es ist auf Hugging Face verfügbar und wird unter der Apple Machine Learning Research Model License bereitgestellt. Der zugehörige Code und das Paper sind ebenfalls öffentlich.
LensVLM ist ein 9B Vision Language Model (VLM), das komprimierte Bilder von Text scannt und dann selektiv nur die relevanten Seiten über erlernte Tools in ihre unkomprimierte Form expandiert.