LLM 分类本质是特征工程

LLM Classification Is Feature Engineering

LLM 分类本质是特征工程

直接把 LLM 当作分类器使用,虽然效果看似不错,但往往缺乏校准能力且难以整合结构化数据。文章指出,LLM 分类的本质其实是特征工程:将 LLM 的预测结果视为特征,再配合逻辑回归等传统机器学习模型,就能获得校准良好的概率输出,并灵活调整精确率与召回率。通过这种思路,我们不仅能利用 LLM 的语义理解能力,还能像传统 ML 那样收集数据、优化特征、调整模型架构。以反讽检测为例,结合 LLM 生成的多维度特征与逻辑回归,显著改善了模型的校准表现,证明了这一范式的有效性。

LLM 分类本质上是非常好的特征工程
  1. vova_hn2

    我觉得这个问题可以通过使用两个 LLM 来自动化:一个更强/更贵的用来生成提示词,另一个较弱的用来做实际分类。近似算法如下:

    1. 给“强”LLM 任务描述和一些带标签的示例,让它为“弱”LLM 生成提示词。

    2. 用第 1 步生成的提示词在训练集上运行“弱”LLM,将其回复作为特征输入到一个较小的 ML 模型(如逻辑回归、决策树等)。

    3. 从训练集中挑选出小模型预测最错误的样本,再让“强”LLM 生成一个新的提示词(类似第 1 步),只不过这次用的是这些分类错误的样本,而不是随机样本。

    4. 用第 3 步生成的提示词运行“弱”LLM,将结果作为新特征加入模型。

    5. 重复步骤 2 到 4,直到该任务的 token 预算耗尽,或在交叉验证集上达到所需分数。

    我本来想写一个开源库来实现这个流程,但不确定是否真有人需要。我猜需要这类东西的人可能已经自己实现了。

  2. softwaredoug

    在我关于 LLM 作为裁判的工作中,我更喜欢把 LLM 的决策作为下游经典 ML 模型的特征,用于最终决策。效果非常好。

    https://softwaredoug.com/blog/2025/01/21/llm-judge-decision-...

  3. xerlait

    他为什么先让标注“讽刺”或“非讽刺”,然后再回答那些特征问题?

    难道反过来不是更好吗?

同日更多故事

2026-09-17