INT8 ConvRot 崛起:FP8 时代终结

Explanation of INT8 ConvRot (FP8 is no longer needed)

INT8 ConvRot 崛起:FP8 时代终结

ComfyUI v0.27.0 原生支持的 INT8 ConvRot 正在重塑 AI 模型量化标准。这项技术通过卷积与旋转算法,巧妙解决了 INT 类型在处理异常值时的精度缺陷,使其性能不仅超越传统的 FP8 和 FP8 Scaled 格式,甚至在 RTX 50 系列显卡上跑赢了 NVFP4。更关键的是,它让老旧的 RTX 20/30 系列显卡也能获得硬件加速红利,而无需等待新一代硬件。无论是 ComfyUI 原生节点还是 Forge Neo,都已全面适配这一格式。随着 Comfy-Org 官方模型的陆续更新,INT8 ConvRot 正迅速成为 8 位量化模型的新标杆,宣告 FP8 时代的落幕。

ConvRot 是一种结合卷积和旋转的技术,通过将异常值分散到多个维度,将其转化为 INT 类型也能轻松处理的数值分布,从而实现了超越 FLOAT 模型格式的性能。
  1. gopalv

    首页上 CloudFlare 的另一篇帖子里有一段很有意思的内容:

    > 这是计算密集型任务,INT4 权重必须先展开回原尺寸,模型才能进行乘法运算,所以这个额外步骤反而让预填充(prefill)变慢了,而不是变快。GLM 在 FP8 下预填充速度约为每秒 10,160 个 token,而 INT4 下仅为 8,660 个。与 KV cache 类似,这种解耦设计将其从一种妥协变成了可选择的方案:我们在 INT4 占优的解码阶段使用它,在 FP8 占优的预填充阶段使用它。

    所以,即便这些改进的适用范围很窄,它们依然很有用,因为系统可以混合搭配以优化性能。

    [1] - https://blog.cloudflare.com/smaller-faster-safer-models/

  2. p1esk

    INT8 权重量化会导致性能下降吗?为什么有人想用 ConvRot 来做 8 位权重?请注意,论文 [1] 聚焦的是 4 位权重和 4 位激活值(W4A4)的量化方案——这是一个更具挑战性的目标。据我理解,采用按输出通道量化的 W8A8 方案早已是成熟解决的问题,根本不需要 GPTQ、SpinQuant 之类花哨的方法。

    [1] https://arxiv.org/abs/2512.03673

  3. randomblock1

    AMD 呢?我猜是不支持,这挺可惜的,毕竟它们在显存性价比方面表现更好。

同日更多故事

2026-08-03