LLM 变身 Jev:单次推理实现决策

Turning GLM-5.3-Flash into a Jev-like decision model

LLM 变身 Jev:单次推理实现决策

我们展示了如何将现成的 LLM 转化为类似 Jev 的决策模型。通过巧妙设计提示词,让 GLM-5.3-Flash 在单次前向传播中输出带概率的 typed decisions,无需微调。在 29 个公开数据集的基准测试中,该方案在决策准确性和速度上与 TypeSafe 的 Jev 持平,甚至支持图像决策。虽然成本略高,但这一方法为高吞吐量场景下的 LLM 决策应用打开了新大门,且能直接利用 vLLM 后端部署。

我们的核心洞察是:让 LLM 预测整个 JSON 对象是不必要的,因为我们已经知道其结构。
  1. ricardobeat

    大家都在这么做以模仿 Jev,但……

    我随手拿了一段 23,000 字(约 ±30k 输入 token)的书籍摘录作为上下文。Jev 的响应时间仍然在 800ms,有时甚至只要 500ms。这相当于 20,000 到 50,000 tok/s 的预填充速度,对于普通 LLM 来说显然是不可能的,就连 Cerebras 也达不到这个速度。

  2. prjkt

    如果我能本地运行,Jev 怎么会更便宜呢?0.5% 预填充,0.1% 解码,99.4% 命中缓存,延迟小于 20ms。

  3. m4y0u

    我的问题是,为什么不用 Jev 呢?它更快也更便宜。

同日更多故事

2026-09-27