单函数Jev式LLM包装器,支持视觉模型
A single function Jev-like wrapper for LLMs, including vision models

受Jev启发,我探索了一种巧妙的技巧:通过读取LLM的token概率来快速分类。只需构造特定提示并请求单个token输出,即可获取模型对选项的置信度。更令人兴奋的是,这种方法同样适用于视觉模型。我在本地实验中扩展了Jev的请求格式,添加了attachments字段以支持图像。使用Gemma 4 12B和RTX 3090,我实现了每秒约1帧的实时分析,能判断画面中是否有人、植物,以及场景的明暗程度。相比专用计算机视觉模型,这种方法的灵活性在于只需修改文本描述即可调整判断条件。
虽然专用的计算机视觉模型效率更高,但我喜欢这里的灵活性:只需通过纯文本描述即可改变判断条件。