AIモデル訓練はパン焼きに似ている:ケント・ベックの比喩
Baking a Model: A Metaphor for LLM Training

ケント・ベックが、LLMの訓練プロセスをパン焼きに例えて解説。事前訓練は「コールドプルーフ」、事後訓練は「成形と焼き上げ」に相当すると述べ、モデルがどのように作られるかを自身の理解に基づいて説明する。
事前訓練はモデル訓練のコールドプルーフだ。材料を混ぜ、いじれない場所に置き、ただ成り行きを見守るしかない。
- unjuno
LLMの事前学習は、人間が事前に状態を明示的に設計するのではなく、シーケンスから有用な状態表現を学習するものと見なせるかもしれません。
従来の多くのソフトウェアシステムでは、アイドル、送信中、完了、エラーなど、状態と遷移を自分たちで定義します。LLMの事前学習はこれとは異なり、モデルは大量のシーケンスから次に来そうなものを予測することを学習します。
LLMが文字通り離散的な内部状態を構築するという意味ではありません。むしろ、予測に有用な文脈の潜在表現を学習します。その意味で、これらの表現は一種の学習された状態と考えることができるでしょう。
これは抽象化と密接に関連しているように思えます。抽象化とは単に情報を捨てることではなく、予測に関係のない違いを抽象化しつつ、重要な違いを保持することです。
2つのシーケンスは表面的には非常に異なって見えても、次に来るものを予測するために同様の基礎となる特徴に依存している場合があります。まれな特徴であっても、予測を変えるならば保持されるべきです。
この観点から、事前学習は有用な圧縮の一形態と見なせます。予測に重要なものを保持し、重要でないものを抽象化する表現を学習するのです。
抽象化、圧縮、予測は、同じプロセスの異なる側面としてどこまで理解できるでしょうか。
- tosh
事前学習の後には、言語を理解し、GPT 3.5やそれ以降の「ベース」モデルのように振る舞うLLMが得られます。
次のトークンを予測するのがかなり得意です。
例えば、「What is the best city?」という入力に対して、質問に答える代わりに「What is the best programming language?」と続けるかもしれません。
回答を得る可能性を高めるには、「The best city is」で始めるでしょう。
(強力なLLMは会話さえもできるようになりますが、まだそのために特別に訓練されているわけではありません)
事後学習では、LLMはユーザーとのやり取りやツールの使用方法などに向けて、さらなる方向付けを行う入力/出力ペアで訓練されます。
訓練の両方の部分には技術が要ります。
現在のモデルがこれほど有用なのは、GPT 3.5以降、事前学習と事後学習の両方で多くの進歩があり、今の状態に到達したからです。
(間違っていたら訂正してください)
事前学習と事後学習に詳しい方々から、今後の進歩はどちらからもたらされる可能性が高いと思うか、ぜひ聞いてみたいです。