Jev 的校准度测试:结果令人失望
How accurately calibrated is Jev?

我深入测试了 TypeSafe 推出的新决策模型 Jev,试图验证其概率分布输出的校准程度。通过对比物理学中已知的 Maxwell-Boltzmann 等经典分布,我发现 Jev 的表现远非完美。尽管它能准确识别问题对应的分布类型,但在生成具体的概率分布时,它表现出强烈的“峰值偏好”,倾向于将概率质量集中在单一选项上,而非均匀分布。在涉及公平骰子或硬币抛掷的测试中,Jev 甚至给出了极度自信的单一结果。这表明,虽然 Jev 作为 System One 模型在速度和成本上极具优势,但其输出的概率校准度目前仍存在显著缺陷,直接用于自动化评估 LLM 答案可能并不可靠。
Jev 表现出强烈的倾向,总是选择那些过于尖锐的分布,并且在处理平滑消失的尾部时存在明显困难。