프레임 선택이 전부다: LLM이 비디오를 보게 만드는 엔지니어링 노트

Frame selection is the whole game: notes on making LLMs watch video

비디오를 LLM에 직접 입력하는 이유는 기사가 이미 압축된 해석이기 때문이다. 모델이 원본을 보면, 리뷰어가 놓친 오류 메시지나 편집 흔적까지 포착할 수 있다. 토큰 예산이 제한적이므로, 장면 감지와 중복 제거를 통해 100~150개의 핵심 프레임을 선별한다. 고정 임계값 대신 롤링 평균을 사용하고, RGB 서명, 액션 채널, 정적 상태 변화를 감지하는 세 가지 중복 제거 채널을 적용한다. 자막과 프레임을 타임라인으로 미리 융합해 정확성을 높였으며, MCP 서버로 어떤 클라이언트에서든 사용할 수 있다.

모델에게 비디오를 주면 압축 단계가 모델로 이동한다. 리뷰어가 말한 모습이 아니라 데모가 실제로 어떻게 보였는지를 본다.

같은 날의 다른 소식

2026-08-04