Ornith-1.5、自己スキャフォールディングから自己改善へ:397BモデルがClaude Opus 4.8に並ぶ

Ornith-1.5: From Self-Scaffolding to Self-Improvement

Ornith-1.5、自己スキャフォールディングから自己改善へ:397BモデルがClaude Opus 4.8に並ぶ

Ornith-1.5は、自己改善ループを拡張し、モデルがタスク提案、スキャフォールド生成、ソリューションのロールアウトを自ら行い、強化学習で継続的に学習する。397B MoE、35B MoE、9B denseの3スケールで提供され、Terminal-Bench 2.1で86.1、DeepSWEで56.0を達成し、Claude Opus 4.8に匹敵する。9B版はモバイル展開可能で、より大規模なモデルを凌駕する。

各トレーニングサイクルは3段階で進行する。環境やコードベース、タスクタイプに関する高レベルの指示、およびモデルの過去のタスク解決履歴へのアクセスが与えられると、システムはモデルがまだ解決していない、より難しいタスクを段階的に提案し、能力のギャップを露呈させ、トレーニングフロンティアを継続的に押し広げる。
  1. montroser

    これが本物だといいですね。Qwenが3.8ラインで35B-A3Bをリリースしないというシグナルが見られるのは残念です。MoEアーキテクチャは、これらのローカルモデルを手頃なコンシューマーハードウェアで実行する上で大きな違いをもたらします。

  2. adagonese

    各サイクルにおけるGPU時間のうち、ロールアウト生成と実際の更新にそれぞれどのくらいの割合が使われたのでしょうか?

  3. prometheus1992

    これを試すのが待ちきれません。Ornith1(9B)は本当に素晴らしいモデルでした。私はローカルでhttps://github.com/deepanwadhwa/samosa-chatを使って実行しています。

  4. bigcat12345678

    Ornith-1.5のベースモデルはどのように開発されたのでしょうか?ベースモデルはオープンウェイトのモデルの一つなのでしょうか、それともOrnithチームがゼロから事前学習したものなのでしょうか?記事ではこの質問に対する答えとなる情報を見つけられませんでした。

  5. jonesy827

    今日、35B-A3Bをウェブスクレイピングの作業で使っていますが、Qwen3.8 27Bと同等の性能でありながら、はるかに高速で、より高い量子化(q4対q8)で動作しています。感銘を受けました。

この日のほかの記事

2026-08-19