GPT-6 Astra ставит блок в миску в 19 из 20 попыток, но пасует перед головоломкой
GPT-6 Astra on robot arms

Сравнение GPT-6 Astra с Claude Fable 5 и Fable 5.1 на одинаковых роботизированных руках YAM показало: на задаче «положи красный блок в миску» Astra справилась в 19 из 20 попыток, тогда как Fable 5.1 — в 8 из 20, а Fable 5 — лишь в 1 из 20. При этом Astra тратила в среднем 2,5 минуты и $0,94 за попытку против 6,8 минут и $2,12 у Fable 5.1. Однако на более сложной задаче с круглой головоломкой Astra достигла лишь 2 успешных вставок из 20, как и Fable 5.1, застревая на финальном этапе.
На задаче с чашей Astra справилась в 19 из 20 попыток, против 8 из 20 у Fable 5.1 и 1 из 20 у Fable 5, затрачивая 2,5 минуты на попытку против 6,8 минут у Fable 5.1, при оценочной стоимости $0,94 за запуск против $2,12.
- baron816
Если вы читаете это и работаете в робототехнической компании или управляете ею, я очень хочу призвать вас создать робота для подбора мусора на городских тротуарах в качестве раннего продукта.
Подбор мусора требует большой ловкости и будет сопряжен со многими трудностями, но я думаю, что это более простая задача, чем многие домашние дела, и она, вероятно, сопоставима с тем, что эти тесты показывают как выполнимое.
Я думаю, вам придется приложить усилия, чтобы люди приняли роботов в своих домах. Если у вас есть роботы в городах, обеспечивающие общественное благо, они не только служат ходячей рекламой вашей компании, но и помогут завоевать доверие, прежде чем вы будете готовы развернуть их в частных пространствах.
Кроме того, правительства (или, возможно, ТСЖ для богатых сообществ) могут быть хорошими первыми клиентами, поскольку у вас может быть сфокусированная стратегия продаж. Политики любят такие заметные проекты по улучшению качества жизни. Если вы сможете показать, что ваши роботы, работающие круглосуточно, могут снизить количество мусора с низкими затратами, многие города захотят их купить.
- gizmodo59
Если вы еще не пробовали использовать компьютер с Astra с codex, я настоятельно рекомендую это сделать. Так же, как gpt 4 и агентное кодирование с cc. Эта штука — самое захватывающее, что я видел за последнее время. А все эти штучки с blender и CAD — вишенка на торте.
И это быстро, они делают много сбросов. Мне кажется, они тратят слишком много денег, но я не жалуюсь. Лучшие 200$ за подписку на ИИ, ИМХО.
- rmonvfer
Я честно поражен Astra: я попросил его создать довольно сложную игру, которую я откладывал более года, и оставил его работать на ночь с включенным использованием компьютера и полным доступом. На следующее утро у меня была полностью функциональная игра. Он скачал Unity, Blender и GIMP и создал все ассеты, а также полную игру, не требуя от меня никаких действий. Игра совсем не тривиальная, и ассеты тоже.
- scronkfinkle
LLM — забавная технология, потому что, с одной стороны, все это, несомненно, впечатляет с точки зрения скорости изменений, которые они принесли, и все же, несмотря на это, я разочарован отсутствием прорывов в вещах, которые мне неинтересны. Я люблю математику и программирование, и LLM в этом довольно хороши; когда они станут хорошо складывать мое белье? Я думаю, что многие работы в робототехнике обещают решить эту категорию «скучных» прорывов, и я оптимистичен, что мы сможем этого достичь, просто интересно, когда.
- yurimo
Я думаю, нам нужно быть честными здесь. Автор основывается на одном небольшом эксперименте по поднятию блока, полагается на целый конвейер IK-контроллера для выполнения задачи и не сравнивает его с полными моделями VLA или WAM. Затем они экстраполируют пропускную способность токенов (заметьте, не то же самое, что пропускная способность контроллера) на предполагаемую временную шкалу 2029 года на основе одного примера.
Код как политика — плохой интерфейс, на мой взгляд, но планирование с помощью VLM многообещающе. Это пробовали в 2022 году https://say-can.github.io/, и недавно переформулировали в https://lianegalanti.github.io/Pigey/
Дело в том, что даже недавний Gemini Robotics 2 выступает за архитектуру, которая имеет VLM-планировщик, а затем контроллер VLA/WAM + локальную небольшую VLA-модель, когда соединение исчезает. И недавние SOTA-архитектуры полагаются на иерархический дизайн.
Я думаю, это может быть разумным подходом. Если бы вы обучили GPT-X на данных робототехники и на вывод действий, поздравляю! Вы только что сделали VLA.
Людям заманчиво просто желать, чтобы одна архитектура делала все, именно поэтому мы получаем такие вещи. Я думаю, что от модульности можно получить гораздо больше, и нам не следует бояться специализации.
- herodoturtle
Я мало знаю о робототехнике, поэтому просто хотел похвалить команду Robocurve за эту статью.
Даже для такого абсолютного новичка в робототехнике, как я, статья была интересной для чтения и легкой для понимания. К тому же она была по делу, без лишней воды.
Просто удовольствие во всех отношениях. Отличная работа, Robocurve.
- drakenot
Станут ли LLM в конечном итоге архитектурой, которая будет управлять беспилотными автомобилями?
Видя, как они играют в Portal и другие видеоигры, мне интересно, помогут ли они в конечном итоге решить последние N% проблем беспилотного вождения.
- gamerDude
Затраты должны будут значительно снизиться либо за счет чипов (но тогда меньше обновлений), либо за счет чего-то еще. 2 доллара за уборку блока — это очень дорогой труд.