AppleのLensVLM、長い文脈を画像に圧縮し必要なページだけを展開

LensVLM: Compressing long context as images, expanding only relevant pages

AppleのLensVLM、長い文脈を画像に圧縮し必要なページだけを展開

Appleが公開したLensVLM-9Bは、テキストを圧縮画像として読み込み、学習済みツールで関連ページだけを非圧縮に展開する9BのVision Language Model。5x・10x・15xの圧縮率に対応し、長文書の質問応答を効率化する。Qwen3.5-9Bをベースに、Hugging Faceでモデルとコードが利用可能。

LensVLMは、圧縮されたテキスト画像を走査し、学習済みツールを通じて関連するページだけを選択的に非圧縮形式に展開する9BのVision Language Model(VLM)です。

この日のほかの記事

2026-09-23