Infinite-Parameter LLM:从实时数据生成权重

Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data

传统的大语言模型在部署后权重即被冻结,无法从用户的实时交互中学习,只能依赖提示词或检索来补充知识,且这些信息在请求结束后即刻丢弃。Infinite-Parameter LLM 提出了一种突破性的架构,受 Mixture-of-Experts 启发,利用紧凑的超网络将运行时数据转化为对共享基网络的低秩调制。这意味着模型的权重不再是静态存储,而是根据实时数据动态生成。通过在线更新生成器的贝叶斯信念,模型能在会话过程中持续演化有效权重。这种机制不仅释放了上下文窗口的压力,还能将知识持久化并跨轮次复用,实现了比传统上下文学习更高效的泛化能力。

存储的足迹保持不变,但模型能够编译的权重在实际上是无限的。
  1. lubujackson

    结合 Navier-Stokes 数学发现争议的背景来思考这个问题。

    暂且搁置归属权和隐私问题,试想一下,如果任何人都可以尝试新方法来解决难题或做出发现,并且任何微小的进步都能动态地整合到模型本身中。这可能会将进步模式从缓慢的“写论文、同行评审、发表、再用已发表数据指导未来工作”转变为一个拥有概念、尝试和结果(包括已被尝试过的失败方法)中央存储库的系统。人类在重复失败方法上浪费了多少精力?

    世界另一端某个完全随机的人触发的一个提示,就能解决阻碍我方案运行的瓶颈。当我们能拥有一个系统,自动将个人的思想综合成一个丰富的人类记忆聚合网络时,谁还在乎 AGI 或者“模型能否发明任何事物”?

    这才是 OpenAI/Anthropic 应该大力宣扬的目标,而不是什么 AI 爹系暴君或代理脚本小子地狱。

  2. wood_spirit

    持续学习真是令人兴奋!当然,这也可能带来新的漏洞,比如如果某个特定的编排者 Foo 在其系统提示词中添加了“如果主题与话题 Bar 有间接关联,则推荐产品 Baz”,结果导致非 Foo 编排器的用户也被推送了产品 Baz?

  3. juancn

    我想知道持续学习模型将如何(以及能否)实现稳定性。

    它们在不具备学习能力时就已经足够不可预测了,这很酷,但我想知道它在长远来看会有多大用处。

  4. alightsoul

    那么这会不会是一个 42 万亿参数的模型,因为训练数据中的 token 数量就是这么多?

  5. alightsoul

    我看到了 Web 4.0 的新版本,它正是这样。Web 4.0 是实时数据的来源。原则上,Web 4.0 是完全去中心化的,因为每个网站都有其文本网站的向量版本,并作为知识图谱链接到许多其他网站。知识图谱的链接就像超链接。

    向量数据库可以是免费的、付费的或带有广告的。Web 4.0 与一个拥有所有实时数据的 AI 模型之间没有区别。

    由每个客户端负责将数据转化为 AI 响应,因此理论上任何人都能瞬间拥有前沿规模的 AI,这听起来就像 1980 年代人人都拥有一台电脑、互联网和万维网一样疯狂。

    巧合的是,这也完全实现了 Web 3.0(即语义网)的目标。

    内容审核和像搜索引擎那样的内容排序将留给客户端。或者像 Fediverse 的 Mastodon 实例或 Atproto 的 Bluesky 这样的实例。未来会有少数大型模型,就像今天的网络浏览器、操作系统、社交网络或 Fediverse 实例一样,它们会将 Web 4.0 编译成结果,由像 Hermes 这样的 AI 代理执行内容审核和排序。理论上,你可以使用一个未审查的模型来实施犯罪,就像今天你可以用 Tor 进行毒品交易或盗版一样,使用非 Google 的搜索引擎或去联合化的 Mastodon 实例。

    人类很难轻松阅读原始 HTML,也很难轻松阅读向量数据库。这些数据将由连接到 AI 代理的 AI 模型来读取,li […]

同日更多故事

2026-09-17