Grok Voice Transcribe 2.0 verdoppelt die Genauigkeit zum gleichen Preis
xAI veröffentlicht Grok Voice Transcribe 2.0, sein neuestes Speech-to-Text-Modell. Es ist doppelt so genau wie Version 1.0 und führt die öffentliche Artificial-Analysis-Bestenliste unter 32 Streaming-Modellen an. Das Modell transkribiert Dutzende Sprachen, erkennt Sprachwechsel automatisch und verbessert die Wortfehlerrate bei kurzen mehrsprachigen Befehlen von 20,6 % auf 6,8 %. Bestehende Speech-to-Text-API-Integrationen profitieren ohne Codeänderung. Der Preis bleibt bei 0,10 Dollar pro Stunde für Batch und 0,20 Dollar für Streaming.
Wir haben schon immer geglaubt, dass der beste Weg, Arbeit voranzubringen, darin besteht, Kontext einmal zu erfassen und ihn überall hin fließen zu lassen. Mit Grok, das die Speech-to-Text-Funktion von Loom antreibt, und Cursor, das daraus Code macht, schließen wir den Kreis vom Kontext zum Code: Aufnehmen, was man meint, und die Arbeit wird erledigt. Das ist ein Ausblick darauf, wohin die KI-gestützte Entwicklung führt.