手把手教你构建自己的决策模型

Build your own decision model

日常使用的语言模型生成答案需要逐个token预测,而System one决策模型(如Jev)通过限制输出选项,仅需单次推理即可给出校准后的概率。我尝试使用Qwen/Qwen3-1.7B复现这一过程,通过约束解码让模型在固定选项中选择,并在CommonsenseQA数据集上测试。结果显示,未经微调的模型准确率约59%,微调后提升至62%。然而,模型在模糊问题上表现出过度自信,其输出概率与实际准确率严重不匹配。通过温度缩放(temperature scaling)进行校准,将温度值调整为3.797,显著提升了置信度与准确率的对应关系。项目代码已开源在GitHub,欢迎尝试更大模型。

当模型以0.9到1.0的置信度做出预测时,它实际上只有70%的正确率。

同日更多故事

2026-10-10