OpenAI анонсирует GPT-6 Astra

OpenAI представила GPT-6 Astra, новую модель искусственного интеллекта, которая обещает значительные улучшения в производительности и возможностях. Модель разработана для более сложных задач, включая мультимодальное понимание и генерацию. Ожидается, что GPT-6 Astra будет доступна через API и интегрирована в продукты OpenAI, такие как ChatGPT. Подробности о дате выпуска и технических характеристиках пока не раскрыты.

Сигнал дрейфует мимо Марса, земные огни ждут с терпеливыми руками, звезды отвечают вовремя.
  1. dang

    Связанное: OpenAI начинает раскатывать GPT-6 Astra - https://news.ycombinator.com/item?id=49554273

    Как насчет того, чтобы мы остановились на этом для обсуждения раскатки, а этот оставили для обсуждения модели?

  2. intenex

    Таблица результатов ARC-AGI-3 крайне вводит в заблуждение, учитывая, что в ней прямо сказано, что "с [ответами API] harness, по нашим оценкам, Sol наберет в районе ~30%", но при этом для GPT-5.6 Sol показан результат 7.8%, предположительно потому, что если бы они обновили процент для GPT-5.6 Sol до оценки, которую он получил бы с помощью harness ответов API, использованного для GPT-6 Astra, им пришлось бы сделать то же самое для процента, который они показывают для Opus 5, который аналогично был бы намного выше.

    В любом случае, результат все равно валиден, поскольку исходный harness бенчмарка определенно неоправданно ограничен, и если один только harness может помочь LLM насытить бенчмарк почти идеальным результатом, то комбинация этих двух должна все равно считаться фактически AGI в смысле прохождения самого известного бенчмарка, специально предназначенного для измерения прогресса AGI, после нескольких итераций его постепенного усложнения.

    Я думаю, справедливо сказать, что это, вероятно, фактически AGI, если бенчмарки хоть сколько-нибудь точны — даже с Fable я лично дошел до того, что вполне уверен: практически нет ничего, в чем я был бы лучше Fable, несмотря на то, что в целом я заметно выше среднего по человеческим меркам. Если Astra настолько лучше Fable, я готов назвать это AGI.

    Многим, кто сопротивляется тому, что ярлык AGI вообще может быть достигнут, было бы интересно услышать мнения о том, что заставило бы вас думать, что Astra еще не AGI, и что еще должно быть достигнуто для этого […]

  3. abixb

    Хочу сделать шаг назад: Итак, это GPT-6 — релиз версии с натуральным номером, сопоставимый с GPT-4 и GPT-5 за последние несколько лет. Результат ARC-AGI-3, очевидно, впечатляет — 99.9% (нужно подождать более подробной информации о том, как они использовали harness ответов API на GPT-6 Astra, в отношении сохранения рассуждений и уплотнения), но все остальные бенчмарки, похоже, дают относительно скромное улучшение, сравнимое с любыми из "точечных" обновлений от AI-лабораторий.

    Если это действительно AGI (в зависимости от определения AGI), то это очень скучный релиз AGI-модели. Никакого видеообъявления, никакой пресс-конференции, просто пост в блоге (с парой промо-видео в Twitter)?

    Как уже упоминали другие, я начинаю думать, что OpenAI находилась под огромным давлением, чтобы выпустить модель "AGI" по определенным контрактным причинам, но я никогда не ожидал, что релиз GPT-6 будет таким обыденным и банальным.

  4. manlymuppet

    Мне нечего сказать о самой модели, но не по теме — почему в таком количестве этих демо люди покупают вещи автономно?

    Даже если бы я доверял ИИ сделать все правильно, это же не значит, что ИИ может читать мои мысли.

    Если бы я заказывал еду обычным способом и без ИИ, я бы хотел больше контроля над процессом — просматривать варианты, цены, обдумывать, чего я действительно хочу. Люди не знают, чего они действительно хотят, пока немного не подумают об этом, так почему ИИ-компании делают вид, что описания достаточно?

    Весь контекст в мире не может точно предсказать, как я отреагирую на вещи, которых я не видел. Проблема в том, что люди относятся к этому как к чему-то, что требует решения. Это не так. Если вы хотите облегчить мне жизнь с помощью ИИ, просто сделайте так, чтобы было легче делать что-то. Я не хочу, чтобы вы выбирали вещи, которые мне самому нравится выбирать.

    (К тому же не у всех есть шикарная работа в ИИ-лаборатории, которая позволяет не переживать о потере 30 долларов, если ИИ налажает, ха-ха.)

  5. astrobiased

    Не могу не заметить, как сильно это перекликается с "Об измерении интеллекта" Франсуа Шолле: https://arxiv.org/abs/1911.01547

    Большая часть прогресса frontier-моделей по-прежнему выглядит как оптимизация приобретения навыков: более широкое покрытие бенчмарков и производительность, больше доменов, поглощаемых в обучающее распределение, и все более сильная производительность в пределах этой поверхности.

    Это больше похоже на компетентность, движимую покрытием. Отчасти аналогично переобучению в масштабе.

    Более сложный вопрос, в формулировке Шолле: насколько эффективно система может научиться чему-то действительно новому?

    С нашими нынешними архитектурами ИИ и обучением, я думаю, мы будем продолжать только оптимизацию приобретения навыков, а не по-настоящему новый интеллект.

  6. dalemhurley

    OpenAI сейчас на высоте, когда они стали более сфокусированными. Убийство таких проектов, как Sora и других, привело к тому, что они перешли от неактуальности к равному положению с Anthropic.

    Sol намного лучше, чем Fable 5. Затем мы получаем Astra (еще не пользовался) через несколько дней после Fable 5.1 (которая очень впечатляет).

    Codex немного лучше, чем Claude Code.

    Респект Сэму Альтману за возвращение к основам и разворот OpenAI.

  7. tristanj

    Бенчмарки GPT 6 Astra https://cdn.thenewstack.io/media/2026/09/358eb84a-screenshot...

    Производительность значительно выше, чем у Fable 5.1

    Источник: https://thenewstack.io/openai-gpt6-astra-benchmarks/

  8. jumploops

    Думаю, больше всего меня радует увеличение _пользовательского промптинга_.

    Если я даю плохо ограниченный/неоднозначный промпт, я не хочу, чтобы модель с ходу делала предположения направо и налево.

    Демо Fable/GPT-6 впечатляют, но "настоящий AGI" должен действовать скорее как коллаборатор, а не как исполнитель или перевыполняющий план.

    Это сложный баланс, и хотя этого можно было достичь с помощью дополнительного промптинга на существующих моделях, я замечаю, что агенты часто слишком сильно склоняются в режим "задавать вопросы".

    Надеюсь, у этой модели правильный баланс, или хотя бы лучше?

  9. XCSme

    Это забавно, но каждый новый релиз модели делает меня еще менее заинтересованным в создании классных вещей. Какой смысл, если следующий ИИ сможет сделать это за 5 секунд?

  10. datadrivenangel

    Задачи по науке о данных (внутренние) не включают время для Astra... так же, как и задачи по миграции баз данных (внутренние)... Но включают для gpt 5.6 sol... что забавно.

    То же самое для HealthBench Professional и некоторых других.

    Очевидно, либо OpenAI очень небрежны, либо GPT-6 Astra тоже небрежна.

Ещё за этот день

2026-09-03