Apple LensVLM:长文档压缩为图,按需展开
LensVLM: Compressing long context as images, expanding only relevant pages
Apple 推出了 LensVLM-9B,这是一个基于 Qwen3.5 的视觉语言模型,专门解决长上下文处理难题。它不再简单地将文档转为文本,而是先将长文档压缩为图像进行扫描,然后利用学习到的工具,仅将相关页面动态展开为未压缩形式。这种“压缩为图、按需展开”的机制,大幅降低了计算成本,同时保留了关键细节。无论是处理学术论文还是长篇报告,LensVLM-9B 都能精准定位信息,为长文档理解提供了全新的思路。
LensVLM 扫描压缩后的文本图像,然后通过学习到的工具,仅将相关页面选择性地展开为未压缩形式。