LLM 变身 Jev:单次推理实现决策
Turning GLM-5.3-Flash into a Jev-like decision model

我们展示了如何将现成的 LLM 转化为类似 Jev 的决策模型。通过巧妙设计提示词,让 GLM-5.3-Flash 在单次前向传播中输出带概率的 typed decisions,无需微调。在 29 个公开数据集的基准测试中,该方案在决策准确性和速度上与 TypeSafe 的 Jev 持平,甚至支持图像决策。虽然成本略高,但这一方法为高吞吐量场景下的 LLM 决策应用打开了新大门,且能直接利用 vLLM 后端部署。
我们的核心洞察是:让 LLM 预测整个 JSON 对象是不必要的,因为我们已经知道其结构。
HN 评论区
25- ricardobeat
大家都在这么做以模仿 Jev,但……
我随手拿了一段 23,000 字(约 ±30k 输入 token)的书籍摘录作为上下文。Jev 的响应时间仍然在 800ms,有时甚至只要 500ms。这相当于 20,000 到 50,000 tok/s 的预填充速度,对于普通 LLM 来说显然是不可能的,就连 Cerebras 也达不到这个速度。
- prjkt
如果我能本地运行,Jev 怎么会更便宜呢?0.5% 预填充,0.1% 解码,99.4% 命中缓存,延迟小于 20ms。
- m4y0u
我的问题是,为什么不用 Jev 呢?它更快也更便宜。