让LLM看懂视频:帧选择才是关键
Frame selection is the whole game: notes on making LLMs watch video
给LLM看视频而非文章,能让模型直接观察原始画面,避免人类作者的筛选偏差。当前视频理解的最大瓶颈是token预算,均匀采样往往埋没关键帧。我开发了一套工程方案,通过动态场景检测、三通道去重(全局、动作、静态细节)以及将字幕与关键帧精准融合,在有限预算内提取最有价值的画面。这套工具已开源,支持通过MCP协议让Claude Desktop等客户端直接调用,让LLM真正“看懂”视频内容。
阅读证词与成为证人,面对的是同一事件,但立场截然不同。