别问 LLM 它的置信度分数

Don't ask an LLM for a confidence score

别问 LLM 它的置信度分数

我见过太多开发者试图从 LLM 中提取置信度分数,这简直是个巨大的误区。让模型自己打分,本质上只是心理安慰,毫无科学依据。LLM 无法可靠地量化自己的正确性,所谓的 0 到 100 的连续分值,不过是把正确性、连贯性等不同维度的问题强行压缩成一个数字。Anthropic 的研究也表明,模型的内省能力极不可靠。DeepMind 甚至发现,让模型自我修正往往会导致表现下降。如果你真的需要置信度,别指望模型自己说,必须通过外部采样和语义熵等严谨方法来测量。

你构建的只是一个心理安慰的把戏,它让输出感觉更可信,却并没有真正提升可信度。
  1. fhdkweig

    这正是我觉得 Watson 在 Jeopardy 挑战赛中最有趣的地方。Watson 对自己的置信度有感知,而且看起来相当准确。它答错的题目,恰恰是那些它知道自己难以理解的。

  2. dmrivers

    帖子开头附近的这句话:

    > “简而言之:让 LLM 生成一个表示其对自己回答有多自信的分数,据我所知,完全没用。”

    这个说法显然过于绝对,而且直接被帖子结尾的内容所反驳:

    > “Tian 等人在《Just Ask for Calibration》一文中发现,采用正确的提示策略,经过 RLHF 训练的模型所表达的置信概率,比模型自身的条件概率校准得更好;而且提示加上温度缩放(temperature scaling)可以将预期校准误差减少一半以上。此外,Anthropic 的《Language Models (Mostly) Know What They Know》一文也发现,让模型估算其自身提出的答案正确的概率,结果令人鼓舞。”

    就我个人的经验而言,明确表达的置信度是一个很有用的工具。当然,你需要一套评分标准和恰当的提示词,但这显然比帖子所倡导的训练一个分类器要省力,而且所需数据也更少。

  3. kqr

    我觉得文中推荐用离散类别而非数值概率来表示置信度,这个观点很有趣,因为它与我读到的所有给人类预测者的建议背道而驰。

    支持数值概率的最简单理由是它易于评估。如果有人声称自己有 90% 的把握,那么他十次里最好能答对九次——不能更少,也不能太多!这在人们学习如何判断自身置信度时非常有用,而大多数人在这方面都很糟糕。(几乎所有人都能通过训练做得更好,但有些人似乎天生就擅长。)

    反对使用类别的典型理由是,人们对同一个词的理解可能大相径庭:https://i.ibb.co/kQT4Ymz/q.png

    看起来,本文通过建立一套固定类别与模型隐含概率之间的对照表,巧妙地绕过了这些问题。这是一个很有趣的方法!

同日更多故事

2026-07-28