Meta、エージェント向けMuse Spark 1.3を公開—コーディング性能とツール呼び出し精度が向上
MetaがMuse Spark 1.3をリリース。エージェントワークフロー向けにトレーニングされ、競争力のあるコーディング性能を実現。初回試行の精度が高く、信頼性の高いツール呼び出しが可能。長期的なタスクでコンテキストと過去の結果を追跡し、複雑な入力に対応。ビデオ、画像、ドキュメントのネイティブなマルチモーダル認識を備え、実際の実行環境で視覚的推論を行う。1Mトークンのコンテキストウィンドウを提供。
Muse Sparkはビデオ、画像、ドキュメントを認識し、その視覚的推論はスクリプト化された手順ではなく実際の実行環境で行われます。スクリーンショットやクリップを与えれば、それを基に構築します。
HNでの議論
255- simonw
llm -m meta-ai/muse-spark-1.3 "Generate an SVG of a pelican riding a bicycle"
https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
4.2266セント、38秒。
比較として、こちらはMuse Spark 1.2で、私が頼んでいないのにアニメーション化してくれました: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
1.3の方が間違いなく良いです - 自転車のフレームも翼もペリカンの帽子も良い。
更新: こちらはMuse Spark 1.3の5つの推論レベルそれぞれに対応する5羽のペリカンを使った別のものです: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
最も高かったのは推論レベルxhighで、7.5セント、1分34秒でした。
そして1.2でも全推論レベルで5羽のペリカンを実行しました。こちらです: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
- superfrank
私は開発にSpark 1.2を使い始めました。なぜなら、Metaにデータをトレーニングさせることを許容できるなら、それは非常に安価で、実際に使ってみて本当に嬉しい驚きがあったからです。決してフロンティアモデルではありませんが、最高級のモデルを必要としない作業には、本当に楽しんで使えました。
少し擬人化していますが、このモデルは自分の弱点を理解していて、自分の意見を押し付けてこないように感じました。つまり、指示したことを実行し、生成されたコードに予期しないものがあった場合、それは多くの場合、私が曖昧または矛盾した指示を与えたためでした。それは、上を行こうとはせず、単にツールのように振る舞いました。それが私がコーディングエージェントに90%以上の時間求めるものです。また、他の現在のモデルの多くよりも、私のコード内の確立されたパターンに従うのがはるかに上手だと感じました。私はOpenAIのモデルの大ファンですが、Spark 1.2は私が5.6 Lunaに期待していたものでした。
1.3を使うのが好奇心と少しの興奮を持って待っていますが、正直なところ、Metaがより良いベンチマークを追求するにつれて、Sparkが私が望まない方法で「役立とう」とする罠に陥り始めるのではないかと少し心配しています。
話は逸れますが、Spark 1.2を使い始めたとき、5.3 Codexがどれほど恋しいかに気づかされました。あのモデルは、私の意見ではコーディングモデルの頂点であり、良いコードを書く方法を知っていながら、予期しない方法で出しゃばったり「役立とう」としたりしませんでした。それで、主要な研究所がコーディングに特化したモデルから離れつつあるように見えることについて考えさせられました[…]
- bertili
DeepSWEは75.4をスコアしました - これはこれまでの最高スコアです。そして驚くほど安いです!
Googleは今日、Gemini 3.8 Flashで数時間トップを保持しましたが、今はSpark 1.3に次ぐ2位です。この競争は価格を下げるでしょう!
- Lucasoato
(少なくともベンチマークでは)SOTAに近づいているモデルです。彼らの製品を改善するために使われるものと、そうでないものとの明確な分離(少なくとも彼らが主張していること)。
Meta、よくやった!本当に。これは、児童のソーシャルメディア中毒に関する180億ドルの訴訟をほとんど忘れさせてくれます。
- jmward01
muse-spark-1.3-contributor。何と言っても、Metaが価格設定を変更して「私たちはこれをトレーニングに使用し、この価値を認めています」と明示したことは、すべてのモデルプロバイダーが行うべきことです。余談ですが、私のトークンをトレーニングのために盗むことがモデルプロバイダーにとってどれほどの価値があるかが、今や完全に明らかになりました。私はトレーニングされないように避けたり、追加料金を払ったり、最善を尽くしていますが、どこかの設定を見逃していることが何度も出てくるようです。これはモデルプロバイダーから見た最初の定量化可能な数字です。訴訟で著作権やその他の損害を定量化するのに役立つかもしれません。
- apodolny
トレーニングに使用されるAPIの割引版とフル価格版を提供するアプローチは良いと思います。合理的で透明性があります。
- keyle
このモデルには今のところ非常に感銘を受けています。非常に速く、本当にうまくやるのに十分な知性があるようです。UI作業(簡単なPython UI)は非常にクリーンで機能的でした。UXは「そこにありました」。
- 7734128
「コントリビューター」にとっては実質無料で、0.2ドル/mtokです。趣味人には断りにくい価格です。