OpenAI anuncia GPT-6 Astra, su nuevo modelo insignia
OpenAI ha presentado GPT-6 Astra, la última versión de su modelo de lenguaje, que promete avances significativos en razonamiento, multimodalidad y personalización. El anuncio, realizado a través de su página oficial, destaca mejoras en la capacidad de comprensión contextual y en la generación de respuestas más precisas y naturales. GPT-6 Astra está diseñado para integrarse en una amplia gama de aplicaciones, desde asistentes virtuales hasta herramientas de desarrollo, y representa un paso adelante en la evolución de la inteligencia artificial conversacional.
GPT-6 Astra marca un hito en la evolución de la IA, acercándonos a una interacción más humana y fluida.
- dang
Relacionado: OpenAI comienza a implementar GPT-6 Astra - https://news.ycombinator.com/item?id=49554273
¿Qué tal si nos quedamos con ese para hablar del despliegue, y este para hablar del modelo?
- intenex
La tabla de resultados de ARC-AGI-3 es extremadamente engañosa dado que claramente afirma que "con el harness de la API de respuestas, estimamos que Sol obtendría una puntuación en el rango de ~30%." pero muestra una puntuación del 7,8% para GPT-5.6 Sol, presumiblemente porque si actualizaran el porcentaje de GPT-5.6 Sol a la puntuación que recibiría con el harness de la API de respuestas que usaron para GPT-6 Astra, tendrían que hacer lo mismo con el porcentaje que muestran para Opus 5, que de manera similar sería mucho más alto.
Independientemente, el resultado sigue siendo válido ya que el harness original del benchmark está definitivamente limitado de manera injusta, y si un harness por sí solo puede ayudar al LLM a saturar el benchmark con una puntuación casi perfecta, entonces la combinación de ambos debe seguir siendo efectivamente AGI en el sentido de superar el benchmark más famoso diseñado específicamente para medir el progreso de la AGI, después de múltiples iteraciones que lo han hecho progresivamente más difícil.
Creo que es justo decir que esto es probablemente AGI efectiva si los benchmarks son remotamente precisos - incluso con Fable, he llegado al punto personalmente donde estoy razonablemente seguro de que esencialmente no hay nada en lo que sea mejor que Fable a pesar de estar generalmente sustancialmente por encima del promedio en benchmarks humanos. Si Astra es mucho mejor que Fable, estoy listo para llamar a esto AGI.
Para las muchas personas que se resisten a la etiqueta de AGI posiblemente jamás alcanzada, me encantaría escuchar opiniones sobre qué les haría pensar que Astra aún no es AGI, y qué aún tendría que lograrse para que esto […]
- abixb
Quiero dar un paso atrás: Entonces, esto es GPT-6 -- el lanzamiento de versión de número natural comparable a GPT-4 y GPT-5 de los últimos años. La puntuación de ARC-AGI-3 es obviamente impresionante al 99,9% (tendremos que esperar más detalles sobre cómo usaron el harness de la API de respuestas en GPT-6 Astra, con respecto a la retención de razonamiento y la compactación), pero todos los demás benchmarks parecen ser una mejora relativamente modesta, comparable con cualquiera de las actualizaciones 'puntuales' de los laboratorios de IA.
Si esto es realmente AGI (sujeto a la definición de AGI que uno tenga), entonces este es un lanzamiento muy aburrido de un modelo AGI. ¿Sin anuncio en video, sin rueda de prensa, solo una publicación de blog (con algunos videos promocionales en Twitter)?
Como otros mencionaron, estoy empezando a pensar que OpenAI estaba bajo una presión inmensa para entregar un modelo 'AGI' por ciertas razones contractuales, pero nunca esperé que el lanzamiento de GPT-6 fuera tan mundano y banal.
- manlymuppet
No tengo nada que decir sobre el modelo en sí, pero sin relación--¿por qué tantas de estas demos incluyen a personas comprando cosas de forma autónoma?
Incluso si confiara en que una IA hace todo bien, no es como si la IA pudiera leer mi mente.
Si estuviera pidiendo comida normalmente y sin IA, querría más control sobre el proceso--revisar las opciones, los precios, pensar en lo que realmente quiero. La gente no sabe lo que realmente quiere hasta que lo ha pensado un poco, así que ¿por qué las empresas de IA hacen parecer que una descripción es todo lo que se necesita?
Todo el contexto del mundo no puede predecir con precisión cómo reaccionaré ante cosas que no he visto. El problema es que la gente trata esto como algo que necesita una solución. No lo necesita. Si quieres hacerme la vida más fácil con IA, solo haz que sea más fácil hacer cosas. No quiero que elijas cosas que yo disfruto activamente elegir yo mismo.
(Tampoco todo el mundo tiene un trabajo cómodo en un laboratorio de IA que haga que no te importe perder $30 si la IA se equivoca jaja.)
- astrobiased
No puedo evitar notar cuánto esto hace eco de 'On the Measure of Intelligence' de François Chollet: https://arxiv.org/abs/1911.01547
La mayor parte del progreso de los modelos frontera todavía parece optimización de adquisición de habilidades: mayor cobertura y rendimiento en benchmarks, más dominios absorbidos en la distribución de entrenamiento, y un rendimiento cada vez más fuerte dentro de esa superficie.
Parece más sobre competencia impulsada por cobertura. Algo análogo al sobreajuste a escala.
La pregunta más difícil, en el marco de Chollet, es: ¿con qué eficiencia puede un sistema aprender a hacer algo genuinamente nuevo?
Con nuestras arquitecturas y entrenamiento de IA actuales, creo que solo continuaremos en la optimización de adquisición de habilidades versus inteligencia verdaderamente novedosa.
- dalemhurley
OpenAI lo está petando ahora que están más enfocados. Matar proyectos como Sora et al. ha hecho que pase de irrelevante a estar a la par con Anthropic.
Sol es mucho mejor que Fable 5. Luego tenemos Astra (aún sin usar) pocos días después de Fable 5.1 (que es muy impresionante).
Codex es ligeramente mejor que Claude Code.
Bien por Sam Altman por volver a lo básico y darle la vuelta a OpenAI.
- tristanj
Benchmarks de GPT 6 Astra https://cdn.thenewstack.io/media/2026/09/358eb84a-screenshot...
El rendimiento es significativamente mayor que Fable 5.1
Fuente: https://thenewstack.io/openai-gpt6-astra-benchmarks/
- jumploops
Creo que lo que más me entusiasma es el aumento en la _interacción con el usuario_.
Si doy un prompt pobremente restringido o ambiguo, no quiero que el modelo haga suposiciones a diestra y siniestra.
Las demos de Fable/GPT-6 son impresionantes, pero la "AGI real" debería actuar más como un colaborador que como un subordinado o un sobrelogrador.
Es un equilibrio difícil de lograr, y aunque esto ha sido posible de conseguir con prompting adicional en los modelos existentes, encuentro que los agentes a menudo se inclinan demasiado hacia el modo de "hacer preguntas".
Esperemos que este modelo tenga el equilibrio adecuado, ¿o al menos mejor?
- datadrivenangel
Tareas de Ciencia de Datos (Interno) no incluye tiempo para Astra... igual que Tareas de Migración de Base de Datos (Interno)... Pero sí para gpt 5.6 sol.... lo cual es gracioso.
Igual para HealthBench Professional y algunos otros.
Claramente o OpenAI es muy descuidado o GPT-6 Astra también es descuidado.
- XCSme
Es divertido, pero cada nuevo lanzamiento de modelo me hace estar menos interesado en crear cosas geniales. Como, ¿cuál es el punto, si la próxima IA puede hacerlo en 5 segundos?