LensVLM: 圧縮された視覚表現における選択的コンテキスト拡張
LensVLM-9B by Apple
Vision-Language Models(VLMs)はテキストをレンダリング画像として処理できるが、圧縮率が高まるにつれて精度が急速に低下する。これは文字がvision encoderの有効解像度を下回り、判別不能になるためである。本論文では、圧縮画像をスキャンし、学習されたツールを用いて関連部分のみを非圧縮形式に選択的に拡張する推論フレームワークおよびpost-trainingレシピであるLensVLMを提案する。Qwen3.5-9B-Baseを基盤とし、LensVLMは4.3倍の実効圧縮率でfull-text upper boundに匹敵する精度を維持し、7つのtext QAベンチマークにおいて最大10.1倍の実効圧縮率でretrieval-based、text-compression、visual-compressionの各ベースラインを上回る。また、multimodal documentやcode understandingタスクにも汎化し、圧縮率が高まるほどベースラインとの精度差が拡大する。分析により、学習によってvisual compressionがレンダリング選択に対して頑健になり、圧縮が進むにつれてモデルが信頼性の低い視覚的読み取りではなく拡張されたコンテンツに依存するようになることが検証された。さらに、レンダリングされたテキストにはtext expansionが、レイアウト手がかりがタスク関連情報を持つネイティブ文書には高解像度画像拡張が適するという実用的なツール選択の指針も得られた。
学習によりvisual compressionがレンダリング選択に対して頑健になり、圧縮が進むにつれてモデルは信頼性の低い視覚的読み取りではなく、拡張されたコンテンツにますます依存するようになる。