GPT-6 Astra coloca el bloque en el bol en 19 de 20 intentos, pero falla en el rompecabezas

GPT-6 Astra on robot arms

GPT-6 Astra coloca el bloque en el bol en 19 de 20 intentos, pero falla en el rompecabezas

OpenAI probó GPT-6 Astra en brazos robóticos YAM con la política de agente Inspect Robots, comparándolo con Claude Fable 5 y 5.1 en dos tareas. En la tarea de colocar un bloque en un bol, Astra completó 19 de 20 intentos (95%), frente a 8 de 20 de Fable 5.1 y 1 de 20 de Fable 5, con un costo estimado de $0.94 por ejecución (vs. $2.12 y $2.69) y un tiempo medio de 2.5 minutos (vs. 6.8 y 8.2). Sin embargo, en la tarea de insertar una pieza de rompecabezas en una ranura, Astra solo completó 2 de 20 intentos, igual que Fable 5.1, y se detuvo en la misma etapa final. Los resultados sugieren que Astra es mucho más eficiente en tareas de manipulación simples, pero no supera a sus competidores en tareas de precisión más complejas.

Astra completa la tarea del bol con mucha más frecuencia, a aproximadamente la mitad del costo por ejecución.
  1. baron816

    Cualquiera que lea esto y trabaje o dirija una empresa de robótica, realmente quiero animarlos a construir un robot para recoger basura de las aceras de la ciudad como producto inicial.

    Recoger basura requiere mucha destreza y vendrá con muchos desafíos, pero creo que es un problema más simple que muchas tareas domésticas y probablemente está a la par de lo que estas pruebas muestran que es factible.

    Creo que van a tener que enfrentar desafíos de relaciones públicas para lograr que la gente reciba robots en sus hogares. Si tienen robots en las ciudades proporcionando un bien público, no solo sirven como anuncios ambulantes para su empresa, sino que también ganarán cierta confianza antes de estar listos para desplegarlos en espacios privados.

    Además, los gobiernos (o quizás las asociaciones de propietarios para comunidades ricas) pueden ser buenos clientes iniciales, ya que pueden tener una estrategia de ventas enfocada. A los políticos les encantan este tipo de proyectos visibles de mejora de la calidad de vida. Si pueden demostrar que sus robots, trabajando las 24 horas, pueden reducir la basura a bajo costo, muchas ciudades querrán comprarlos.

  2. gizmodo59

    Si no han probado el uso de computadora con Astra con Codex, lo recomiendo muchísimo. Al igual que GPT-4 y la codificación agéntica con Codex. Esto es lo más emocionante que he visto en mucho tiempo. Y luego todo lo de Blender y CAD es la guinda del pastel.

    Y es rápido, hacen muchos reinicios. Siento que están gastando demasiado dinero, pero no me quejo. Mejor suscripción de IA por 200$ en mi humilde opinión.

  3. rmonvfer

    Estoy sinceramente asombrado por Astra. Le pedí que construyera un juego bastante complejo que he estado posponiendo por más de un año y lo dejé funcionando toda la noche con uso de computadora y acceso completo habilitado. A la mañana siguiente tenía un juego completamente funcional construido. Descargó Unity, Blender y GIMP y creó todos los activos, así como el juego completo, sin que yo tuviera que hacer nada. El juego no es trivial en absoluto, ni tampoco los activos.

  4. scronkfinkle

    Los LLM son una tecnología curiosa porque, por un lado, todo esto es innegablemente impresionante dado el ritmo de lo que han cambiado, y sin embargo, a pesar de eso, me encuentro decepcionado por la falta de avances en cosas que no me resultan interesantes. Me gustan las matemáticas y la programación, y los LLM son bastante buenos en eso; ¿cuándo van a ser buenos doblando mi ropa? Creo que gran parte del trabajo en robótica promete resolver esta categoría de avances "aburridos", y soy optimista de que podremos lograrlo, solo me pregunto cuándo.

  5. yurimo

    Creo que debemos ser honestos aquí. El autor se basa en un pequeño experimento de recoger un bloque, depende de un pipeline completo de control IK para hacer el trabajo, y no lo compara con modelos VLA o WAM completos. Luego procede a extrapolar el rendimiento de tokens (que no es lo mismo que el rendimiento del controlador) a una supuesta línea de tiempo de 2029, basándose en un solo ejemplo.

    Código como política es una mala interfaz en mi opinión, pero la planificación con VLM tiene potencial. Esto se intentó en 2022 https://say-can.github.io/, y recientemente se reformuló en https://lianegalanti.github.io/Pigey/

    El caso es que incluso el reciente Gemini Robotics 2 aboga por una arquitectura que tiene un planificador VLM y luego un controlador VLA/WAM, más un pequeño VLA local cuando la conexión desaparece. Y las arquitecturas SOTA recientes se basan en un diseño jerárquico.

    Creo que esta podría ser una forma sensata de abordarlo. Si entrenaras a GPT-X con datos de robótica y para generar acciones, ¡felicidades! Acabas de hacer un VLA.

    Es tentador que la gente desee una sola arquitectura que lo haga todo, por eso obtenemos cosas como esta. Creo que hay mucho más que ganar con la modularidad y no deberíamos temer a la especialización.

  6. herodoturtle

    No sé mucho sobre ingeniería robótica, así que solo quería felicitar al equipo de Robocurve por este artículo.

    Incluso para un principiante absoluto en robótica como yo, el artículo fue interesante de leer y fácil de entender. Además, fue directo al grano, sin divagaciones innecesarias.

    Todo un placer. Bien hecho, Robocurve.

  7. drakenot

    ¿Se convertirán los LLM eventualmente en la arquitectura que impulse los coches autónomos?

    Al verlos jugar a Portal y otros videojuegos, tengo curiosidad por saber si eventualmente ayudarán a resolver ese último N% de la conducción autónoma.

  8. gamerDude

    Los costos tendrán que bajar muchísimo, ya sea mediante chips (pero entonces menos actualizaciones) o algo más. $2 por guardar un bloque es mano de obra muy cara.

Más de este día

2026-09-06