OpenAI выпустила GPT-Live-1 в API: голосовой агент сокращает перебивания почти на 80%

GPT‑Live‑1 in the API

GPT-Live-1 теперь доступен в API по цене $0.05 за минуту. Модель одновременно слушает и говорит, сама обрабатывает перебивания и шум, а глубокие рассуждения делегирует бэкенд-моделям вроде GPT-6 Astra или Luna. В тестах Full Duplex Bench она обошла GPT-Realtime-2.1 на 30 процентных пунктов, а в паре с Astra заняла первое место на Tau3. Speak уже зафиксировала почти 80% сокращение перебиваний в языковом тренажёре.

В ранних оценках Speak обнаружила, что GPT-Live-1 даёт учащимся больше времени подумать, прежде чем языковой тьютор ответит, сокращая перебивания почти на 80% по сравнению с предыдущими turn-based системами.
  1. dbbk

    Я так этого ждал! Я учу испанский, поэтому сделал приложение, которое учит меня испанскому, но с гиперфокусом на сценариях из моей жизни, например «смотрю матч Барсы в баре в Барселоне». Там есть тренировка по флеш-карточкам с FSRS и практика живого разговора.

    Я считаю, что образование — это очень малоисследованная область для таких моделей живого разговора. Да, можно просто использовать ChatGPT Live, но это свободная форма без структуры, там нет учебной программы или возможности показывать вспомогательные визуальные материалы и т. д. В глобальном масштабе, если дать детям собственного персонального репетитора вместо того, чтобы полагаться только на групповое обучение, это могло бы привести к огромному скачку в успешных образовательных результатах.

  2. agentdev001

    Перепост моего комментария из https://news.ycombinator.com/item?id=49646963

    Поздравляю с запуском. Я возился с этим последние несколько часов — супер-супер круто. Я с нетерпением ждал, когда это появится в API, потому что, конечно, не было варианта с очень высокой точностью для встраиваемого голосового интерфейса перед заданным харнессом. Пока это меня просто поражает!

    (Побочный вопрос: есть ли одно место, где можно следить за обновлениями API — которое реально покрывает всё, что меняется? Насколько помню, было пару добавлений, о которых вы твитили, но они так и не попали в чейнджлог API ;] )

  3. almogo

    Даже как человек, очень ориентированный на ИИ, я не вижу здесь достаточного количества аргументов в пользу этого. Я почти никогда не хочу говорить с ИИ. Я просто не верю, что у меня получится полезное голосовое взаимодействие. Может, агенты здесь, чтобы это исправить, но есть 30 лет действительно негативного опыта с роботами-телефонными ботами, который нужно преодолеть, и я не думаю, что какой-то новый API изменит это в одночасье.

  4. kailpa1

    Думаю, это может быть полезно в случае изучения чего-либо через обучение кого-то другого, где этот кто-то другой — ИИ. Мы все знаем, что обучение через преподавание — отличный способ увидеть пробелы в своих знаниях и проверить, можешь ли ты объяснить тему достаточно просто, чтобы «ученик» её понял. Но найти «ученика» — это самое сложное в этом процессе. Замена ученика этой моделью, а может, и более сильной reasoning-моделью позади, звучит как достаточно хорошая замена реального человека для этого случая.

  5. ndom91

    Давно хотел попробовать это поверх https://github.com/TristanBrotherton/voicepe-realtime с HomeAssistant VoicePE.

    Кто-нибудь ещё что-то собрал с HA / Voice PE?

    Похоже, нужна вторая модель для function calling, чего не было у gpt-realtime-2.5, и аудиоконвейер чипа XMOS в Voice PE может не очень подходить для полнодуплексного обмена, как теперь поддерживает gpt-live-1.

Ещё за этот день

2026-09-11