LensVLM-9B by Apple
Vision-Language Models (VLMs) 能够处理渲染为图像的文字,但在高压缩率下准确率会下降。LensVLM 提出了一种推理框架和后训练方案,通过扫描压缩图像并利用学习到的工具选择性地扩展相关部分,从而在保持高准确率的同时实现高压缩。基于 Qwen3.5-9B-Base 构建的 LensVLM 在 4.3 倍有效压缩率下保持了与全文本上限相当的准确率,并在高达 10.1 倍压缩率下优于基于检索、文本压缩和视觉压缩的基线模型。该模型在七个文本问答基准(text QA benchmarks)上表现优异,并成功泛化到多模态文档理解和代码理解任务。分析表明,随着压缩率的增加,模型越来越依赖扩展内容而非不可靠的视觉阅读,且针对渲染文本应优先选择文本扩展,而针对原生文档则适合高分辨率图像扩展。