LensVLM: 텍스트의 압축된 시각적 표현을 위한 선택적 컨텍스트 확장

LensVLM-9B by Apple

LensVLM: 텍스트의 압축된 시각적 표현을 위한 선택적 컨텍스트 확장

Vision-Language Models (VLMs)는 텍스트를 렌더링된 이미지로 처리하여 긴 토큰 시퀀스 없이도 텍스트를 이해할 수 있다. 그러나 이미지 압축률이 높아지면 문자 크기가 vision encoder의 유효 해상도보다 작아져 정확도가 급격히 떨어진다. 본 논문에서는 LensVLM을 제안한다. LensVLM은 추론 프레임워크와 후속 학습 레시피로, VLM이 압축된 이미지를 스캔한 후 학습된 도구를 통해 관련 이미지만 선택적으로 원본 해상도로 확장하도록 한다. Qwen3.5-9B-Base를 기반으로 한 LensVLM은 4.3배 효과적 압축에서 전체 텍스트 상한선에 필적하는 정확도를 유지하고, 10.1배 압축까지 retrieval 기반, 텍스트 및 시각 압축 베이스라인을 능가한다. 또한 멀티모달 문서 및 코드 이해 작업으로 일반화되며, 압축이 증가할수록 베이스라인 대비 정확도 향상이 커진다. 분석 결과, 학습을 통해 시각 압축이 렌더링 선택에 강건해지고, 압축이 커질수록 모델이 불안정한 시각적 읽기보다 확장된 콘텐츠에 더 의존하게 됨을 확인했다. 또한 텍스트 확장은 렌더링된 텍스트에, 고해상도 이미지 확장은 레이아웃 단서가 중요한 네이티브 문서에 적합하다는 실용적 도구 선택 지침을 제공한다.

LensVLM은 4.3배 효과적 압축에서 전체 텍스트 상한선에 필적하는 정확도를 유지하고, 10.1배 효과적 압축까지 retrieval 기반, 텍스트 및 시각 압축 베이스라인을 능가한다.

이 날의 다른 글

2026-09-23