Apple, 긴 문맥을 이미지로 압축하는 LensVLM-9B 공개

LensVLM: Compressing long context as images, expanding only relevant pages

Apple, 긴 문맥을 이미지로 압축하는 LensVLM-9B 공개

Apple이 9B 규모 Vision Language Model인 LensVLM-9B를 Hugging Face에 공개했다. 텍스트를 압축된 이미지로 스캔한 뒤, 학습된 도구를 통해 관련 있는 페이지만 원본 형태로 선택적으로 확장하는 방식이다. 5x, 10x, 15x 압축 옵션을 지원하며 Qwen3.5-9B-Base를 기반으로 파인튜닝됐다. 코드와 논문도 함께 공개됐다.

LensVLM is a 9B Vision Language Model (VLM) that scans compressed images of text, then selectively expands only the relevant pages to their uncompressed form via learned tools.

이 날의 다른 글

2026-09-23