GPT‑Live‑1 llega a la API: escucha y habla a la vez, y reduce las interrupciones casi un 80%
GPT‑Live‑1 in the API
OpenAI lanza GPT‑Live‑1 en la API, un modelo de voz full-duplex que escucha y habla al mismo tiempo, simplifica la arquitectura de agentes de voz y delega el razonamiento a modelos como GPT‑6 Astra. En evaluaciones tempranas, Speak redujo las interrupciones casi un 80% frente a sistemas por turnos. Incluye soporte para telefonía, control de tono y estilo, y un precio de $0.05 por minuto.
GPT‑Live‑1 handles listening and speaking in a single model, simplifying the voice layer.
- dbbk
¡Llevaba esperando esto! Estoy aprendiendo español, así que construí una app para enseñarme español, pero hiperenfocada en escenarios de mi vida, por ejemplo "ver un partido del Barça en un bar de Barcelona". Hace entrenamiento con flashcards FSRS y práctica de conversación en vivo.
Creo que la educación es un área muy poco explorada para estos modelos de conversación en vivo. Sí, puedes usar simplemente ChatGPT Live, pero eso es libre y sin estructura, no tiene un plan de estudios ni puede presentar apoyos visuales, etc. A gran escala, si puedes dar a los niños su propio tutor personal individual en lugar de depender solo de la enseñanza en grupo, podría haber un salto enorme en los resultados educativos exitosos.
- agentdev001
Reposteo mi comentario de https://news.ycombinator.com/item?id=49646963
Felicidades por el lanzamiento. He estado trasteando con esto durante las últimas horas: súper, súper genial. Esperaba con entusiasmo que llegara a la API, porque, obviamente, no había una opción de muy alta fidelidad para una interfaz de voz lista para usar delante de un harness dado. ¡Hasta ahora esto me está dejando alucinado!
(Pregunta aparte, ¿hay un único lugar donde uno pueda seguir las actualizaciones de la API que realmente cubra todo lo que cambia? Si mal no recuerdo, ha habido un par de adiciones que has tuiteado, pero que nunca llegaron al changelog de la API ;] )
- almogo
Incluso como alguien realmente pro-IA, simplemente no hay suficientes argumentos de venta para mí aquí. Casi nunca quiero hablar con una IA. Simplemente no creo que vaya a tener una interacción de voz útil. Quizá los agentes estén aquí para arreglar eso, pero hay 30 años de precedentes realmente negativos de bots telefónicos robóticos que superar, y no creo que una nueva API vaya a cambiar eso de la noche a la mañana
- kailpa1
Creo que esto podría ser útil para el caso de aprender algo enseñándoselo a otra persona, y siendo esa otra persona la IA. Todos sabemos que aprender enseñando es una gran manera de ver los huecos en tu conocimiento y comprobar si puedes explicar el tema de forma lo bastante sencilla como para que el "estudiante" lo entienda. Pero encontrar al "estudiante" es lo difícil en este proceso. Reemplazar al estudiante con este modelo, y quizá con un modelo de razonamiento mejor detrás, suena como un reemplazo suficientemente bueno de una persona real, para este caso.
- ndom91
Llevo tiempo queriendo probar esto sobre https://github.com/TristanBrotherton/voicepe-realtime con el VoicePE de HomeAssistant
¿Alguien más ha montado algo con HA / el Voice PE ya?
Parece que necesita un segundo modelo para hacer function calling, cosa que gpt-realtime-2.5 no hacía, y el pipeline de audio del chip XMOS del Voice PE podría no encajar bien con el ida y vuelta full duplex, como lo que ahora soporta gpt-live-1.