连续扩散语言模型为何死而复生

Continuous Diffusion Language Models (CDLM's)

连续扩散语言模型为何死而复生

在经历了数年的沉寂后,连续扩散语言模型(CDLM)正迎来复兴。自2023年因训练效率远低于自回归模型而几乎被弃用以来,研究界一度全面转向离散扩散方法。然而,近期的一系列新研究迹象表明,这一趋势正在逆转。本文将回顾从Diffusion-LM到Plaid-1B的技术演进,探讨为何CDLM曾因效率问题遭遇“灭绝”,以及它凭借在不确定性表示和采样算法上的独特优势,如何重新挑战自回归模型的霸权地位。

2023年之后,该领域几乎所有的新研究都采用了离散扩散,而用于语言的连续扩散则走向了灭绝。
  1. janalsncm

    > [2020/2021 年] 自回归模型的统治地位远不如今天稳固:GPT-3 虽然引起了一些关注,但“ChatGPT 时刻”直到 2022 年末才到来

    我不同意这个观点。在 2020 年,Decoder(解码器)模型在聊天领域绝对是主导。GPT2 当时被认为太危险而无法发布,我还记得当时拼命想挤进 GPT3 的等待名单。它确实有效。

    (我唯一能接受的例外是 Encoder-Decoder 模型,现在这些任务通常由 Decoder-only 模型完成。)

    但真正让它走向主流的是 RL(强化学习)。先是 RLHF,然后是像 DPO 这样设置起来没那么麻烦的改进。在此基础上再加扩散模型,只会让事情变得更麻烦。

    在 ChatGPT 之前,真的没有什么“预训练”和“后训练”的概念。一切都是预训练。正是后训练让机器人变得善于对话,而不仅仅是“接着你写的内容继续写”。

    简而言之,扩散模型从未流行起来,因为它只是生成 token 的一种更复杂的方式,而真正的问题在于如何让 token 符合正确的分布。

  2. 2001zhaozhao

    我很想看到能以不同速率进行思考的模型,并且能在输出文本的同时(而不是在所有输出之前)输出一个思考草稿区。

    目前,模型必须依赖可读性较差的压缩 CoT(思维链)来获得每 token/每步的高智能,但有了扩散模型,它们只需要每步输出更多 token 即可。

  3. p1esk

    读到一篇非 AI 生成的内容,感觉真让人耳目一新。

  4. vatsachak

    我觉得自回归 LLM 上还有很多低垂的果实可以摘,比如 Encoder(编码器)部分。

  5. Marchant_hq

    CDLMs 听起来很有前景,能生成更流畅、更连贯的文本。很期待看到它们如何解决 token 级别的不连续性问题。

同日更多故事

2026-08-30