NVIDIA、Nemotron 3.5 Lightningでエージェント型AIのタスク完了速度を30%高速化

Nvidia Nemotron 3.5 lightning and NeMo Switchyard

NVIDIA、Nemotron 3.5 Lightningでエージェント型AIのタスク完了速度を30%高速化

NVIDIAは、オープンモデル「Nemotron 3.5 Lightning」と、モデルルーティング用のオープンソースライブラリ「NeMo Switchyard」を発表した。Nemotron 3.5 Lightningは300億パラメータのMoEモデルで、同クラス比4倍の出力速度と30%のタスク完了時間短縮を実現。NeMo Switchyardは、各リクエストを最適なモデルに自動ルーティングし、品質を維持しながらコストを最大3分の1に削減する。CrowdStrike、Harvey、CodeRabbitなどが採用し、ローカル実行にも対応する。

NeMo Switchyardは、フロンティアレベルの精度を維持しながら、タスク完了コストをOpus 4.8単体のほぼ3分の1に削減します。
  1. kentonv

    偶然ですが、今日はコーディングタスク用の小規模(約30B)なセルフホスト可能なモデルを試していました。具体的には、それらをCloudflare OS(私が開発に関わっているもの)に組み込んで、それぞれに共同ホワイトボードを構築するよう依頼していました。

    Mixture-of-Experts(MoE)モデル(Qwen 3.6-35B、Nemotron 3.5 Lightning)は、これが本当に苦手だと分かりました。まったく仕事をやり遂げられず、完全に脱線してしまいました。ただ、速度は本当に速いです!

    一方、約30Bの高密度(dense)モデル(MoEではない)はかなり優秀でした。Muse Glimmer、Gemma 4-31B、Qwen 3.6-27B、Laguna XS[0]を試しました。これらはすべて、何のガイダンスもなしに(エラーログをモデルにフィードバックする以外は)動作する共同ホワイトボードアプリを構築できました。また、それぞれに、構築したホワイトボードのAPIを呼び出して猿を描くようにも依頼しました。Lagunaはランダムな落書きを描きましたが、他のモデルはすべて猿らしいものを描くことができました。

    (比較として、フロンティアモデルはエラーなしでアプリを一発で書きます。)

    なお、Qwen 3.6とGemma 4の両方に、MoEと高密度の両方のバリアントがあります。これは非常に混乱を招きます。なぜなら、例えばollamaのモデルインデックスは通常、サイズだけでバリアントを区別しているからです。しかし、MoEと高密度では、実際のパフォーマンスに大きな違いがあります。個人的には、Qwen 3.6-moeとQwen 3.6-denseのように、あるいはQwen 3.6-fastとQwen 3.6-smartのように、サフィックスを使うべきだと思います...

    [0] 追記:Laguna XSはMoEであることが判明しました。私の誤解でした。高密度モデルと同様の性能でした。しかし、それがコードを書けなかった理由を説明しているかもしれません。そして、[原文は途中で切れています]

  2. jmward01

    ラマパocalypseの大きな結果の一つは、小型で効率的なモデルへのさらなる注目だと思います。個人的には、数兆パラメータのモデルは根本的に何かが欠けており、より小型で効率的なものへの推進が、将来の進歩につながる進化的な構造変化を促進するだろうと信じています。

  3. thehamkercat

    > NeMo Switchyard、スマートルーティングのためのオープンソースライブラリ

    > デプロイされると、NeMo Switchyardは各リクエストを、そのジョブに最も能力があり適切なモデルにインテリジェントにルーティングできます。

    このようなルーターは、2回目のリクエストを送信するときにプロンプトキャッシュをどのように処理しますか?

    セッションごとにモデルを固定するのですか?しかし、その場合、そのセッションの2番目のメッセージは適切なモデルに送信されず、前回と同じモデルにのみ送信されることになります。

  4. average_bloke

    提案があります:

    - 問題:AIによる情報の大洪水

    - 解決策:人間は文章でのコミュニケーションにおいてミニマリストなスタイルを採用すべき。

    - 例:このウェブサイトのページ全体が10個の箇条書きで済む。

  5. docheinestages

    彼らは好都合にも、Artificial AnalysisのグラフにQwenシリーズのモデルを含めないことに決めました。リーグ外のMaxバリアントを除いては。せめて勇敢で正直であってほしい。

  6. WalterGR

    この以前の投稿には、Nemotronに関するコメントが24件あります:https://news.ycombinator.com/item?id=49257947

  7. mark_l_watson

    新しい小規模モデルのリリースの波が大好きです。NVIDIAのモデルがApple Silicon上でMLXを使ってこんなにうまく動作するのは、嬉しい驚きです。今朝、古い(安い)Macでnemotron-3.5-lightning:30b-mlxをOpenCodeと一緒に使っていましたが、遅いことを除けば、悪い経験はありませんでした。

  8. HackerThemAll

    NVIDIAからのオープンソースモデルは、後で彼らのチップを買うための無料の麻薬です。

この日のほかの記事

2026-08-11