OpenAI startet GPT-Live-1 in der API: Sprach-KI mit nahtloser Unterbrechungsbehandlung

GPT‑Live‑1 in the API

OpenAI stellt GPT-Live-1 in der API vor, ein Echtzeit-Sprachmodell, das Zuhören und Sprechen in einem einzigen Modell vereint. Es verarbeitet Unterbrechungen, Hintergrundgeräusche und Stille ohne die typischen Verzögerungen verketteter STT-LLM-TTS-Architekturen. Entwickler können Ton, Tempo und Stil per System-Prompt steuern und Reasoning-Aufgaben an Backend-Modelle wie GPT-6 Astra delegieren. Erste Tests zeigen fast 80 % weniger Unterbrechungen. Der Preis liegt bei 0,05 $ pro Minute.

GPT-Live-1 kann Zuhören und Sprechen in einem einzigen Modell bewältigen und so die Sprachschicht vereinfachen.
  1. dbbk

    Ich habe darauf gewartet! Ich lerne Spanisch, also habe ich eine App gebaut, die mir Spanisch beibringt, aber hyperfokussiert auf Szenarien in meinem Leben, zum Beispiel "ein Barça-Spiel in einer Bar in Barcelona anschauen". Sie macht FSRS-Karteikartentraining und Live-Konversationsübung.

    Ich denke, Bildung ist ein sehr unerforschtes Gebiet für diese Live-Konversationsmodelle. Ja, man kann einfach ChatGPT Live benutzen, aber das ist frei und unstrukturiert, hat keinen Lehrplan und kann keine unterstützenden Visualisierungen präsentieren usw. Im großen Maßstab, wenn man Kindern ihren eigenen persönlichen individuellen Tutor geben könnte, anstatt sich allein auf Grupppenunterricht zu verlassen, könnte es einen riesigen Sprung bei erfolgreichen Bildungsoutcomes geben.

  2. agentdev001

    Ich poste meinen Kommentar von https://news.ycombinator.com/item?id=49646963 erneut

    Glückwunsch zum Launch hier. Ich habe in den letzten Stunden damit herumgespielt – super super cool. Ich habe sehnsüchtig darauf gewartet, dass das in die API kommt, weil es natürlich keine super hochauflösende Option für eine Drop-in-Sprachschnittstelle vor einem gegebenen Harness gab. Das haut mich bisher um!

    (Nebenbei, gibt es einen einzigen Ort, an dem man Updates zur API verfolgen kann – der tatsächlich alles abdeckt, was sich ändert? IIRC gab es ein paar Ergänzungen, die du getwittert hast – aber nie im API-Changelog auftauchten ;] )

  3. almogo

    Selbst als jemand, der wirklich KI-vorwärts eingestellt ist, gibt es hier einfach nicht genug Verkaufsargumente für mich. Ich möchte fast nie mit einer KI sprechen. Ich glaube einfach nicht, dass ich eine nützliche Sprachinteraktion haben werde. Vielleicht sind Agenten hier, um das zu beheben, aber es gibt 30 Jahre wirklich negativer Präzedenzfälle von Roboter-Telefonbots, die es zu überwinden gilt, und ich glaube nicht, dass eine neue API das über Nacht ändern wird

  4. kailpa1

    Ich denke, dass dies für den Fall nützlich sein könnte, etwas zu lernen, indem man es jemand anderem beibringt, und dieser jemand anderes die KI ist. Wir alle wissen, dass Lernen durch Lehren eine großartige Möglichkeit ist, die Lücken in seinem Wissen zu erkennen und zu prüfen, ob man das Thema einfach genug erklären kann, damit der "Schüler" es versteht. Aber den "Schüler" zu finden, ist das Schwierige in diesem Prozess. Den Schüler durch dieses Modell zu ersetzen, und vielleicht ein besseres Reasoning-Modell dahinter, klingt nach einem ausreichend guten Ersatz für eine echte Person für diesen Fall.

  5. ndom91

    Ich wollte das schon auf https://github.com/TristanBrotherton/voicepe-realtime mit dem HomeAssistant VoicePE ausprobieren

    Hat sonst noch jemand etwas mit HA / dem Voice PE zusammengehackt?

    Es sieht so aus, als bräuchte es ein zweites Modell für Function Calling, was gpt-realtime-2.5 nicht tat, und die Audio-Pipeline des Voice PE XMOS-Chips könnte nicht gut für Vollduplex-Hin-und-Her geeignet sein, wie es gpt-live-1 jetzt unterstützt.

Mehr von diesem Tag

2026-09-11