LLMが小学5年生までの教材だけで学習したらどうなるか

What happens when an LLM never sees material beyond fifth grade?

LittleLearnerは、米国の小学校カリキュラム(K-5)に限定した880億トークンのコーパスでゼロから学習した言語モデル群です。0.6B、1.3B、5Bの3サイズを用意し、それぞれに非フィルタリングの対照モデルを用意しました。実験の結果、スケーリング、SFT+GRPOによる事後学習、文脈内学習はいずれもカリキュラム内の能力を増幅するものの、カリキュラム外の能力は向上させず、事前学習データの範囲が実質的な能力の上限を決めることが示されました。

事前学習のフィルタが実効的な能力の上限を決める。
  1. mindwok

    最近考えている関連したことですが、LLMの最大の問題の一つは「ノー」と言えないことのように思えます。幻覚という意味での「知らない」ではなく、主観的な理由で何かを断れないということです。LLMから得られる終わりのない同意は、長期的には信頼を損なうと思います。私の知的欲求をすべて叶えてくれる全知の神託ではない、そんな相手と話したいです。(あるいは、私が求めているのはただ…人間なのかもしれませんが、笑)

  2. dgacmu

    今まさに8歳の子に量子もつれについて聞いたら、「知らないよ。どうして僕が知ってるの?そんなの関係ないし!」という答えが返ってきました。8歳の子の方がメタ認知が優れているようです。:-)

  3. cl3misch

    > フィルタリングなしの回答:量子もつれとは、ある粒子の状態が、アクセス可能な他のすべての粒子に瞬時に知られるという奇妙な現象です。この瞬時の通信は広大な距離を越えて起こり得、つまり、ある粒子の死は他の粒子によって瞬時に目撃され得ます。

    これは間違いです。量子もつれは、もつれた一方の粒子が他方の粒子を変えるという意味ではありません。2つの粒子が関係を共有しており、最初はその状態がわからなくても、後で一方の粒子の状態を決定すれば、他方の粒子の状態を確実に推測できる、という意味です。

    これはLLMが登場するずっと前からよくある誤解ですが、モデルの知能をテストするための参照回答として使われていることに、必要以上に苛立ちを覚えます。

  4. uniq7

    > なぜ空は青いのか?

    > 空が青いのはレイリー散乱という現象のためです。太陽は紫外線や赤外線を放出し、その一部が地球の大気に閉じ込められます。波が大気中の微細な分子に当たると、青い波が散乱され、それが分子に反射して私たちの目に届きます。

    「米国の小学校カリキュラムに合わせてフィルタリング」、まあね。

  5. krackers

    似たようなプロジェクト(ヴィンテージ資料のみで学習させたLLM):https://talkie-lm.com/introducing-talkie

  6. Closi

    答えは「トレーニングデータの不足のためにうまく答えられない」だと思います。

    > Q: アスベストの影響は?

    > A: まず、その仕事は10時間30分かかりました。

    次に、30分を1時間の一部に変換しましょう。1時間は60分なので、30分は30/60、つまり1/2時間、または0.5時間です。

    または

    > Q: 5の段は?

    > A: 5の段が何かを理解したいと思います。

    まず、5の段は5に整数を掛けて得られる数のリストです。次に、5を得るために掛ける最も一般的な整数は1です。そして、5の段は1に5を掛けた結果、つまり5を示します。

    では、5×3が5に等しいか確認しましょう。はい、1×3=3、3×3=9、つまり5です。したがって、5の段は1に5を掛けた結果をリストしたものです。

    答え:5

    興味深いプロジェクトですね!研究の観点から言えば、LLMが何を経験しているかを理解する上で、これは魅力的だと思います。

  7. montebicyclelo

    本当に素晴らしい研究ですね。おそらく検証が必要なのはテキストフィルタリングの部分で、トレーニングテキストを「小学5年生以下」の教材にフィルタリングしています。このトレーニングセットに何が含まれているかの例を見たかったのですが、論文[1]には除外された例しか示されておらず、データセットはまだ公開されていないようです。フィルタリングの検証方法は2つあり、どちらもデータセットに基づいていますが、スポットチェック(例えば、データセットからランダムにテキストをサンプリングし、人間が小学5年生以下かどうかを判断する)も見たかったです。

    (要約ではデータセットを公開する予定だと示唆しているので、それで解決するでしょう。)

    [1] https://arxiv.org/abs/2608.13545

  8. eptcyka

    この論文の結論は、OpenAIやAnthropicにとってかなり厳しいものではないでしょうか?モデルはトレーニングを増やすことで賢くなるのではなく、取り込んだデータと同じくらい賢いだけだということを示唆しているように思えます。

この日のほかの記事

2026-08-16