Muse Spark 1.3: Metas neues KI-Modell meistert Coding-Agenten mit multimodaler Wahrnehmung
Meta hat Muse Spark 1.3 vorgestellt, ein KI-Modell, das speziell für agentische Workflows trainiert wurde und eine hohe Leistung im Wettbewerbs-Coding bietet. Entwickler können eine höhere Genauigkeit beim ersten Versuch und zuverlässiges Tool-Calling erwarten. Das Modell verarbeitet Video, Bilder und Dokumente und führt visuelle Argumentation in einer echten Ausführungsumgebung aus. Muse Spark 1.3 ist über die Meta Model API und OpenRouter verfügbar.
Muse Spark verarbeitet Video, Bilder und Dokumente, und seine visuelle Argumentation läuft in einer echten Ausführungsumgebung statt über skriptgesteuerte Schritte.
- simonw
llm -m meta-ai/muse-spark-1.3 "Erzeuge ein SVG eines Pelikans, der Fahrrad fährt"
https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
4,2266 Cent, 38 Sekunden.
Zum Vergleich hier Muse Spark 1.2, der es animiert hat, ohne dass ich darum gebeten habe: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
Der von 1.3 ist definitiv besser – besserer Fahrradrahmen, besserer Flügel, besserer Pelikanhut.
UPDATE: Hier ist noch einer mit fünf Pelikanen für jede der fünf Denkstufen von Muse Spark 1.3: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
Der teuerste war Denkstufe xhigh – 7,5 Cent, 1m34s.
Und ich habe auch fünf Pelikane auf allen Denkstufen für 1.2 laufen lassen, hier: https://tools.simonwillison.net/markdown-svg-renderer?url=ht...
- superfrank
Ich habe angefangen, Spark 1.2 für die Entwicklung zu nutzen, denn wenn man bereit ist, Meta mit den eigenen Daten trainieren zu lassen, war es spottbillig, und ich war wirklich angenehm überrascht. Es ist keineswegs ein Spitzenmodell, aber für Arbeiten, die kein Top-Modell erforderten, habe ich es wirklich gerne genutzt.
Ich vermenschliche es ein wenig, aber es fühlte sich so an, als wüsste es um seine Schwächen und würde mir nicht seine Meinung aufzwingen. Damit meine ich, dass es das tat, was ich ihm sagte, und wenn etwas Unerwartetes im Code war, den es ausgab, dann oft, weil ich mehrdeutige oder widersprüchliche Anweisungen gegeben hatte. Es versuchte nicht, über sich hinauszuwachsen, sondern verhielt sich einfach wie ein Werkzeug, und das ist es, was ich zu 90 %+ der Zeit von einem Coding-Agenten will. Ich hatte auch das Gefühl, dass es etablierte Muster in meinem Code viel besser befolgte als viele andere aktuelle Modelle. Ich bin ein großer Fan von OpenAIs Modellen, und Spark 1.2 war das, was ich von 5.6 Luna erwartet hatte.
Ich bin neugierig und ein wenig aufgeregt, 1.3 zu nutzen, aber ehrlich gesagt auch ein wenig besorgt, dass Spark, während Meta nach besseren Benchmarks strebt, in die Falle tappen könnte, auf eine Weise "hilfreich" sein zu wollen, wie ich es nicht möchte.
Nebenbei: Als ich anfing, Spark 1.2 zu nutzen, wurde mir klar, wie sehr ich 5.3 Codex vermisse. Dieses Modell war meiner Meinung nach der Höhepunkt der Coding-Modelle, denn es wusste, wie man guten Code schreibt, versuchte aber nicht, über das Ziel hinauszuschießen oder auf unerwartete Weise "hilfreich" zu sein. Das brachte mich zu dem Gedanken, dass die großen Labore sich von coding-fokussierten Modellen zu entfernen scheinen […]
- bertili
DeepSWE erreicht 75,4 – das ist die bisher beste Punktzahl. Und es ist wahnsinnig günstig!
Google hatte heute für ein paar Stunden die Spitze mit Gemini 3.8 Flash inne, steht nun aber hinter Spark 1.3 an zweiter Stelle. Dieser Wettbewerb wird die Preise in den Keller treiben!
- Lucasoato
Ein Modell, das (zumindest in Benchmarks) näher an SOTA herankommt. Eine klare Trennung zwischen dem, was zur Verbesserung ihrer Produkte verwendet wird, und dem, was nicht (zumindest behaupten sie das).
Gute Arbeit, Meta! Wirklich. Das lässt mich fast die 18-Milliarden-Dollar-Klage wegen sozialer Medienabhängigkeit von Kindern vergessen.
- jmward01
muse-spark-1.3-contributor. Sag, was du willst, aber Meta, das die Preisgestaltung ändert, um explizit zu sagen: "Wir trainieren damit und bewerten es so" – das sollten alle Modellanbieter tun. Nebenbei ist jetzt völlig offensichtlich, wie viel das Stehlen meiner Tokens für das Training den Modellanbietern wert ist. Ich vermeide es/ zahle extra/ tue mein Bestes, um sicherzustellen, dass nicht mit mir trainiert wird, aber es scheint immer wieder aufzutauchen, dass ich irgendwo eine Einstellung übersehen habe. Dies ist die erste quantifizierbare Zahl, die ich von einem Modellanbieter gesehen habe. Vielleicht kann sie bei Klagen helfen, den Schadensersatz für Urheberrechtsverletzungen oder anderes zu beziffern?
- apodolny
Mir gefällt der Ansatz, eine rabattierte Version der API anzubieten, die zum Trainieren verwendet wird, im Vergleich zur Vollpreisversion. Scheint vernünftig und transparent.
- keyle
Ich bin bisher sehr beeindruckt von diesem Modell. Es ist schnellschnell und scheint gerade intelligent genug zu sein, um wirklich gut zu sein. Seine UI-Arbeit (einfache Python-UI) ist sehr sauber und funktional. Die UX war "da".
- 7734128
Praktisch kostenlos für "Contributors" bei 0,2 USD/mtok. Das wird für Hobbyisten schwer abzulehnen sein.