LensVLM-9B von Apple
LensVLM-9B by Apple
Vision-Language Models (VLMs) können Text als gerenderte Bilder verarbeiten, wodurch die Tokenisierung langer Textsequenzen entfällt. Da VLM-Bildencoder feste Bildgrößen auf eine feste Anzahl visueller Tokens abbilden, bietet die Rendering-Auflösung einen fein abgestuften Kompressionsparameter. Die Genauigkeit sinkt jedoch schnell mit zunehmender Kompression, da Zeichen unter die effektive Auflösung des Vision Encoders schrumpfen. LensVLM, ein Inferenzframework und Post-Training-Rezept, ermöglicht es VLMs, komprimierte Bilder zu scannen und nur relevante Bildbereiche selektiv über erlernte Tools auf ihre unkomprimierte Form zu erweitern. Basierend auf Qwen3.5-9B-Base hält LensVLM die Genauigkeit vergleichbar mit der Volltext-Obergrenze bei 4,3-facher effektiver Kompression und übertrifft retrieval-basierte sowie text- und visuell-komprimierte Baselines bis zu 10,1-facher effektiver Kompression über sieben Text-QA-Benchmarks. LensVLM generalisiert zudem auf multimodale Dokument- und Code-Verständnisaufgaben, wobei der Genauigkeitsvorteil gegenüber Baselines mit steigender Kompression wächst. Die Analyse zeigt: Training macht visuelle Kompression robust gegenüber Rendering-Entscheidungen, und mit zunehmender Kompression verlässt sich das Modell stärker auf erweiterte Inhalte statt auf unzuverlässiges visuelles Lesen. Daraus ergibt sich praktische Tool-Auswahl: Textexpansion ist für gerenderten Text vorzuziehen, während hochauflösende Bildexpansion für native Dokumente geeignet ist, deren Layout-Hinweise aufgabenrelevante Informationen tragen.
LensVLM hält die Genauigkeit vergleichbar mit der Volltext-Obergrenze bei 4,3-facher effektiver Kompression und übertrifft retrieval-basierte, text- und visuell-komprimierte Baselines bis zu 10,1-facher effektiver Kompression über sieben Text-QA-Benchmarks.