GLM 自建推理基建:迈向递归自改进

GLM Built Its Own Inference Infrastructure

GLM 自建推理基建:迈向递归自改进

我们在开发 GLM 时发现,模型不仅能写代码,还能构建自己的推理基础设施。在超过 10 万块国产 AI 加速器的集群上,我们利用 Infra Agent 从零搭建了 GLM-5.3-Flash 的生产级服务。通过引入“密集反馈”机制,将端到端指标转化为可归因的工程反馈,模型在两周内完成了从适配到上线的全过程,吞吐量提升 3 倍。这不仅是工程能力的突破,更是 Recursive Self-Improvement 的早期雏形:AI 正在开始设计并训练自己的继任者。

当意识到这项工作将直接改变下一代模型的训练方式时,我们更加确信:我们的继任者正是我们亲手创造的 AI 系统。
  1. zicohacks

    美国芯片出口限制实际上可能成为中国 AI 基础设施的优势。中国企业被迫加速研发自己的 AI 芯片。

  2. dada216

    我们在一个由超过 10 万台中国制造的 AI 加速器组成的集群上,从零开始构建了一套完整的生产级推理服务。GLM-5.3-Flash 的所有生产推理都运行在该系统上。

  3. kgeist

    我采用过类似的方法:利用自动化 AI 代理在反馈循环中优化算子(kernels),并找出 CPU 预言机与 CUDA 算子之间的数值差异。通常它能轻松解决数值问题(它会逐层比较输出,找出分歧点),但到目前为止,无论我给它投喂多少不同的 SOTA 模型,甚至展示其他推理引擎的参考代码,它们都无法达到我的速度(我的引擎有一项参考代码中找不到的修改,尽管很多内容相似)。要么是我做错了什么,要么 z.ai 的基础设施代理实际上是一个代理群(agent swarm),也就是带有启发式规则的暴力穷举。我的项目才两周,也许我只是需要更多时间。

  4. throwa356262

    "我们实施了一系列激进的内存优化,包括……"

    这整件事听起来像是工业级的自动科研,而且是由真正懂行的人做出来的。

  5. Havoc

    有趣的是,中美供应商在公告语气上似乎正在趋同。

    GLM 过去更偏向技术细节,而不是像现在这样对 RSI 等未来发展进行推测。

    另外很好奇这 10 万台加速器是否完全是本地制造的。如果这真的是从光刻、内存、设计到所有组件的全流程端到端国产化,那确实是一项了不起的成就。

  6. konart

    要是这套基础设施能扛住所有流量就好了。我试过通过 z.ai 使用 glm,速度慢得像蜗牛。

    同时你的使用限制非常严格,所以在很多情况下,你甚至没法让它跑一整晚,因为你会比那更快达到限额。

  7. KronisLV

    是时候转向消费级 GPU 了,毕竟我买不到那块 Intel Arc B770。

  8. chung8123

    我可能漏掉了什么,但我访问他们网站时发现,他们的价格比 Claude 还贵。那我为什么要选 GLM 而不是 Claude?难道只是他们的套餐里包含更多 tokens 吗?

同日更多故事

2026-09-17