Explorative Modeling:生成式模型新范式

Explorative modeling: Train on the best of K guesses

Explorative Modeling:生成式模型新范式

传统生成模型常因预测多解而输出模糊平均,Alexi Gladstone 提出的 Explorative Modeling 通过训练时让模型猜测 K 个结果并仅优化最佳匹配,成功解锁了预训练的第三维度。这一方法不仅将样本效率提升 6.2 倍,还实现了真正的端到端生成,在控制任务上以 256 倍更少的推理算力匹配 Diffusion 模型表现。它打破了必须将生成过程拆解为多步的传统思路,让模型能直接学习数据分布,显著提升了图像、视频和语言任务的泛化能力与参数效率。

当预测存在多个正确答案时,最好的单一预测往往是它们的平均值,而数据的平均值通常是一个糟糕的答案,看起来完全不像真实数据。
  1. Straw

    虽然这个想法挺有意思,但作者似乎对生成式模型的工作原理有些误解。

    他们反复声称,以前的方法依赖分解(factorization)将问题拆解为可猜测的块,以避免“模糊问题”。这是一种误解。以前的方法是通过输出分布(distribution)而非单点(point)来建模,从而解决这个问题。分解只是表示分布的一种方式,但关键在于,即使对于我们要预测的小块,我们输出的也是一个分布,而不是点估计。

    分解模型完全有能力生成电视雪花噪点图像。每个单独的猜测都是不可能的,但它们并不会生成一张恒定的灰色平均图像。

    归一化流(Normalizing flows)虽然不被认为特别高效,但它们完全没有采用分解,也不分小步进行,却依然没有模糊问题,因为它们预测的是分布。

    他们的方案看起来像是隐变量模型(latent variable model)的硬版本。这可能是一个好主意,但并非像他们暗示的那样是根本性的变革。

  2. ollin

    这篇论文展示了将较旧的“赢家通吃”(winner-take-all)思想(用于学习 K 模态生成模型,参见例如 https://arxiv.org/abs/1612.00197, https://arxiv.org/abs/2211.14286)与现代扩散/流(diffusion/flow)流程的巧妙集成。就目前的实现而言,我认为它有一些缺点:

    1. 训练期间需要额外进行 K-1 次前向传播

    2. 采样行为不准确(会以相等的概率采样所有 K 个模态,而不是按比例采样)

    不过,我认为通过稍微调整实现,这两个缺点都可以缓解(你可以让模型在一次前向传播中联合预测 K 个模态,以及每个模态成为最小损失模态的概率,然后利用这些概率在推理时进行正确加权的模态采样)。

    话虽如此,我不确定这种策略是否像作者希望的那样具有普适性。特别是:

    1. 对于高度条件化的图像生成(如现代商业扩散流程,它们使用大型 LLM 作为预处理器),大部分低频的颜色/布局决策已经由条件信号为你做好了。扩散过程主要需要生成高频细节,而对于这些细节,存在大量同样有效的模态。

    2. 对于 LLM 本身,序列生成过程已经被分解为一个离散分类问题,因此不存在需要修复的模态涂抹(mode smearing)问题。

  3. kamranjon

    这太棒了,我认为这最终可能会成为一个相当重要的进展。

    我刚刚读了这篇关于扩散 Gemma 工作原理的精彩解析:https://newsletter.maartengrootendorst.com/p/a-visual-guide-...

    关于将其应用于自回归 LLM 的困难——我在想,这类混合模型是否可能是这种方法的绝佳候选者。

同日更多故事

2026-08-01