Infinite-Parameter LLM:从实时数据生成权重
Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data
传统的大语言模型在部署后权重即被冻结,无法从用户的实时交互中学习,只能依赖提示词或检索来补充知识,且这些信息在请求结束后即刻丢弃。Infinite-Parameter LLM 提出了一种突破性的架构,受 Mixture-of-Experts 启发,利用紧凑的超网络将运行时数据转化为对共享基网络的低秩调制。这意味着模型的权重不再是静态存储,而是根据实时数据动态生成。通过在线更新生成器的贝叶斯信念,模型能在会话过程中持续演化有效权重。这种机制不仅释放了上下文窗口的压力,还能将知识持久化并跨轮次复用,实现了比传统上下文学习更高效的泛化能力。
存储的足迹保持不变,但模型能够编译的权重在实际上是无限的。
HN 评论区
38- lubujackson
结合 Navier-Stokes 数学发现争议的背景来思考这个问题。
暂且搁置归属权和隐私问题,试想一下,如果任何人都可以尝试新方法来解决难题或做出发现,并且任何微小的进步都能动态地整合到模型本身中。这可能会将进步模式从缓慢的“写论文、同行评审、发表、再用已发表数据指导未来工作”转变为一个拥有概念、尝试和结果(包括已被尝试过的失败方法)中央存储库的系统。人类在重复失败方法上浪费了多少精力?
世界另一端某个完全随机的人触发的一个提示,就能解决阻碍我方案运行的瓶颈。当我们能拥有一个系统,自动将个人的思想综合成一个丰富的人类记忆聚合网络时,谁还在乎 AGI 或者“模型能否发明任何事物”?
这才是 OpenAI/Anthropic 应该大力宣扬的目标,而不是什么 AI 爹系暴君或代理脚本小子地狱。
- wood_spirit
持续学习真是令人兴奋!当然,这也可能带来新的漏洞,比如如果某个特定的编排者 Foo 在其系统提示词中添加了“如果主题与话题 Bar 有间接关联,则推荐产品 Baz”,结果导致非 Foo 编排器的用户也被推送了产品 Baz?
- juancn
我想知道持续学习模型将如何(以及能否)实现稳定性。
它们在不具备学习能力时就已经足够不可预测了,这很酷,但我想知道它在长远来看会有多大用处。
- alightsoul
那么这会不会是一个 42 万亿参数的模型,因为训练数据中的 token 数量就是这么多?
- alightsoul
我看到了 Web 4.0 的新版本,它正是这样。Web 4.0 是实时数据的来源。原则上,Web 4.0 是完全去中心化的,因为每个网站都有其文本网站的向量版本,并作为知识图谱链接到许多其他网站。知识图谱的链接就像超链接。
向量数据库可以是免费的、付费的或带有广告的。Web 4.0 与一个拥有所有实时数据的 AI 模型之间没有区别。
由每个客户端负责将数据转化为 AI 响应,因此理论上任何人都能瞬间拥有前沿规模的 AI,这听起来就像 1980 年代人人都拥有一台电脑、互联网和万维网一样疯狂。
巧合的是,这也完全实现了 Web 3.0(即语义网)的目标。
内容审核和像搜索引擎那样的内容排序将留给客户端。或者像 Fediverse 的 Mastodon 实例或 Atproto 的 Bluesky 这样的实例。未来会有少数大型模型,就像今天的网络浏览器、操作系统、社交网络或 Fediverse 实例一样,它们会将 Web 4.0 编译成结果,由像 Hermes 这样的 AI 代理执行内容审核和排序。理论上,你可以使用一个未审查的模型来实施犯罪,就像今天你可以用 Tor 进行毒品交易或盗版一样,使用非 Google 的搜索引擎或去联合化的 Mastodon 实例。
人类很难轻松阅读原始 HTML,也很难轻松阅读向量数据库。这些数据将由连接到 AI 代理的 AI 模型来读取,li […]