连续扩散语言模型为何死而复生
Continuous Diffusion Language Models (CDLM's)

在经历了数年的沉寂后,连续扩散语言模型(CDLM)正迎来复兴。自2023年因训练效率远低于自回归模型而几乎被弃用以来,研究界一度全面转向离散扩散方法。然而,近期的一系列新研究迹象表明,这一趋势正在逆转。本文将回顾从Diffusion-LM到Plaid-1B的技术演进,探讨为何CDLM曾因效率问题遭遇“灭绝”,以及它凭借在不确定性表示和采样算法上的独特优势,如何重新挑战自回归模型的霸权地位。
2023年之后,该领域几乎所有的新研究都采用了离散扩散,而用于语言的连续扩散则走向了灭绝。
HN 评论区
34- janalsncm
> [2020/2021 年] 自回归模型的统治地位远不如今天稳固:GPT-3 虽然引起了一些关注,但“ChatGPT 时刻”直到 2022 年末才到来
我不同意这个观点。在 2020 年,Decoder(解码器)模型在聊天领域绝对是主导。GPT2 当时被认为太危险而无法发布,我还记得当时拼命想挤进 GPT3 的等待名单。它确实有效。
(我唯一能接受的例外是 Encoder-Decoder 模型,现在这些任务通常由 Decoder-only 模型完成。)
但真正让它走向主流的是 RL(强化学习)。先是 RLHF,然后是像 DPO 这样设置起来没那么麻烦的改进。在此基础上再加扩散模型,只会让事情变得更麻烦。
在 ChatGPT 之前,真的没有什么“预训练”和“后训练”的概念。一切都是预训练。正是后训练让机器人变得善于对话,而不仅仅是“接着你写的内容继续写”。
简而言之,扩散模型从未流行起来,因为它只是生成 token 的一种更复杂的方式,而真正的问题在于如何让 token 符合正确的分布。
- 2001zhaozhao
我很想看到能以不同速率进行思考的模型,并且能在输出文本的同时(而不是在所有输出之前)输出一个思考草稿区。
目前,模型必须依赖可读性较差的压缩 CoT(思维链)来获得每 token/每步的高智能,但有了扩散模型,它们只需要每步输出更多 token 即可。
- p1esk
读到一篇非 AI 生成的内容,感觉真让人耳目一新。
- vatsachak
我觉得自回归 LLM 上还有很多低垂的果实可以摘,比如 Encoder(编码器)部分。
- Marchant_hq
CDLMs 听起来很有前景,能生成更流畅、更连贯的文本。很期待看到它们如何解决 token 级别的不连续性问题。