让LLM看懂视频:帧选择才是关键

Frame selection is the whole game: notes on making LLMs watch video

给LLM看视频而非文章,能让模型直接观察原始画面,避免人类作者的筛选偏差。当前视频理解的最大瓶颈是token预算,均匀采样往往埋没关键帧。我开发了一套工程方案,通过动态场景检测、三通道去重(全局、动作、静态细节)以及将字幕与关键帧精准融合,在有限预算内提取最有价值的画面。这套工具已开源,支持通过MCP协议让Claude Desktop等客户端直接调用,让LLM真正“看懂”视频内容。

阅读证词与成为证人,面对的是同一事件,但立场截然不同。
  1. jrochkind1

    "Dedup 最初只是一个比较器,每次真实画面让它出丑,它就增加一个通道。"

    有没有可能读到一篇不是由 LLM 撰写的 LLM 文章?

  2. nl

    实际的项目 README 看起来更像是人写的,而且确实挺有意思:https://github.com/HUANGCHIHHUNGLeo/claude-real-video

  3. quaverquaver

    或许用运动表征而非一系列帧来建模人们观看视频时的感知会更有效——高度压缩的格式在这方面甚至可能直接派上用场?

同日更多故事

2026-08-04