JevBench:52 个决策模型的终极排名

Show HN: JevBench, a reproducible benchmark for typed decision models

JevBench:52 个决策模型的终极排名

Benchmark Heaven 发布了 JevBench v1.3.0,这是专为 Jev 类决策模型打造的基准测试,对 52 个系统进行了严格评估。测试涵盖 534 个决策场景,其中包含 220 个高难度任务,从德国服务器逐一运行。评分体系综合了 Intelligence(智能)、Calibration(校准)、Speed(速度)和 Cost(成本)四大维度,各占 25% 权重。结果显示,TypeSafe AI 的 Jev 1.13.0 以 74.4 分领跑,而开源项目 SemIf 和 djev 紧随其后。值得注意的是,部分大型模型如 DeepSeek V4.1 Flash 虽在智能项得分极高,但因成本过高导致总分受限。该榜单不仅揭示了当前决策模型的优劣,还强调了在智能与成本之间寻找平衡的重要性。

JevBench 是 Benchmark Heaven 专门为 Jev 类决策模型打造的基准测试,输入状态和有限规则,输出带类型的决策答案。

同日更多故事

2026-09-22