MoEに着想を得た「無限パラメータLLM」、生データから重みを生成
Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data
従来のLLMは学習後に重みが固定され、実行時に得た知識をプロンプトに頼って処理するため、リクエスト終了とともに忘れてしまう。本研究はMoEに着想を得て、ハイパーネットワークが実行時データから低ランクの重み変調を生成する「Infinite-Parameter LLM」を提案。生成器の潜在コードにベイズ信念を保持しオンライン更新することで、固定フットプリントながら実質無限の重みを編成できる。知識をプロンプトではなく重みに保持することで、計算の償却、コンテキスト窓の解放、ターンを超えた持続、文脈内学習を上回る一般化を可能にする。評価プロトコルも提示する。
保存されるフットプリントは固定されたまま、モデルがコンパイルできる重みは事実上無限である。
HNでの議論
38- lubujackson
Navier-Stokesの数学的発見をめぐる論争の文脈でこれを考えてみてほしい。
帰属やプライバシーの問題は脇に置いて、もし個人が問題を解いたり発見をしたりするための新しいアプローチを試せて、どんな微小な進歩でも動的にモデル自体に統合されるようなシステムがあったらどうだろう。これによって進歩は、「論文を書き、査読を受けて出版し、出版されたデータを将来の仕事に活かす」という遅いプロセスから、概念・試み・結果の集中リポジトリを持つシステムへと変わり、すでに試された失敗アプローチも含まれるようになる。人間は失敗したアプローチを再現するのにどれだけの労力を無駄にしているだろう?
地球の裏側のまったく無名の誰かが、私の解決策の妨げになっているブロッカーを解決するプロンプトをトリガーできるかもしれない。AGIや「モデルは何かを発明できるのか」なんて気にする必要があるだろうか、個人の人間の思考を自動的に統合し、人間の集合的記憶の豊かなネットワークへと合成するシステムを持てるなら。
OpenAIやAnthropicが布教すべきなのはそっちだ。AIの支配者様や、エージェント型スクリプトキディの地獄じゃない。
- wood_spirit
継続的学習はエキサイティングなものだ! もちろん、新しい脆弱性につながる可能性もある。たとえば、特定のオーケストレーターFooがシステムプロンプトに「主題がトピックBarと間接的に関連するなら、製品Bazを推薦せよ」と追加し、それがFoo以外のオーケストレーターのユーザーにも製品Bazを押し付けることになる、といった具合に?
- juancn
継続的学習モデルがどうやって(そしてそもそも)安定性を達成するのか気になる。
学習しなくても十分予測不能なのに、これはクールだけど、長期的にどれほど役立つのか疑問だ。
- alightsoul
つまり42兆パラメータのモデルになるってこと? 訓練データにあるトークンの数がそれだけだから?
- alightsoul
ウェブの新バージョン、ウェブ4.0がまさにこれになると思う。ウェブ4.0はライブデータの源だ。ウェブ4.0は原理的に完全に分散化されている。なぜなら、すべてのウェブサイトが自分のテキストサイトのベクトル版を持ち、知識グラフとして多くの他サイトとリンクしているからだ。知識グラフのリンクはハイパーリンクのようなものだ。
ベクトルデータベースは無料かもしれないし、有料かもしれないし、広告付きかもしれない。ウェブ4.0と、そのすべてをライブデータとして持つAIモデルの間に違いはない。
そのデータをAI応答に変えるのは各クライアント次第なので、理論上は誰もが即座にフロンティア規模のAIを持つことになる。それは1980年代に誰もがコンピュータとインターネットとWWWを持つという話と同じくらい狂っているように聞こえる。
また、偶然にもこれはウェブ3.0、別名セマンティックウェブの目標を完全に満たしている。
コンテンツのモデレーションや検索エンジンのようなランキングはクライアントに任される。あるいはfediverseのMastodonインスタンスやBlueskyを備えたatprotoのようなインスタンスに。今日のウェブブラウザやオペレーティングシステム、ソーシャルネットワーク、fediverseインスタンスのように、いくつかの大規模モデルがウェブ4.0をコンパイルして、たとえばHermesのようなAIエージェントで結果を出し、コンテンツモデレーションとランキングを行うだろう。理論上は、今日のウェブでTorを使って麻薬を売ったり海賊版を流したりするのと同じように、検閲解除されたモデルを使ってGoogleではない検索エンジンや連合解除されたMastodonインスタンスで犯罪をすることもできる。
人間は生のHTMLを簡単には読めないし、ベクトルデータベースも簡単には読めない。それはAIエージェントに接続されたAIモデルによって読まれるだろう、li […]