OpenAIのGPT-6 Astraページが404エラーを表示、公開は幻に終わる
OpenAIが公開したGPT-6 Astraの発表ページが、アクセス時点で404エラーを返している。ページには「Signal drifts past Mars / Ground lights wait with steady hands / Stars answer in time」という詩と、gpt-5.6-solというモデルへのリンクが表示されるのみで、GPT-6 Astraに関する具体的な情報は一切得られない。公開が取り消されたのか、URLが誤っているのかは不明だが、ユーザーは混乱している。
HNでの議論
982- dang
関連: OpenAIがGPT-6 Astraの展開を開始 - https://news.ycombinator.com/item?id=49554273
展開について話すのはそちらのスレッドで、モデルについて話すのはこちらのスレッドにしましょう。
- intenex
ARC-AGI-3のスコアカードは非常に誤解を招く。なぜなら、そこには「[responses API]ハーネスを使えば、Solは約30%のスコアになるだろう」と明記されているのに、GPT-5.6 Solのスコアとして7.8%を示しているからだ。おそらく、GPT-5.6 Solのパーセンテージを、GPT-6 Astraで使用したresponses APIハーネスで得られるスコアに更新した場合、同様にOpus 5についても、彼らが示しているパーセンテージを大幅に引き上げざるを得なくなるからだろう。
それでも、結果は依然として有効だ。元のベンチマークハーネスは確かに不当にハンディキャップを負っている。もしハーネスだけでLLMがほぼ完璧なスコアでベンチマークを飽和させられるなら、その組み合わせは、AGIの進歩を測定するために特別に設計された最も有名なベンチマークを通過するという意味で、事実上AGIと見なせるだろう。ベンチマークは何度も難しくされてきたが。
ベンチマークがおおよそ正確なら、これはおそらく事実上のAGIだと言っても過言ではないと思う。Fableでさえ、私は個人的に、人間のベンチマークでかなり平均以上であるにもかかわらず、Fableより自分が優れている点は基本的に何もないと確信している段階に来ている。AstraがFableよりこれほど優れているなら、ここでAGIと呼ぶ準備はできている。
AGIというレッテルが達成される可能性に抵抗する多くの人々に、AstraがまだAGIではないと考える理由と、それがAGIになるために何が達成される必要があるのか、ぜひ意見を聞いてみたい。
- abixb
一歩引いて考えたい: つまり、これはGPT-6だ。ここ数年でGPT-4やGPT-5に相当する、自然数バージョンのリリースだ。ARC-AGI-3のスコアは99.9%で明らかに印象的だが(GPT-6 Astraでどのようにresponses APIハーネスを使用したか、推論の保持と圧縮に関して詳細を待つ必要がある)、他のすべてのベンチマークは比較的小さな改善で、AIラボの「ポイント」アップデートのいずれかに匹敵する。
これが本当にAGI(各自のAGIの定義によるが)なら、これは非常に退屈なAGIモデルのリリースだ。ビデオ発表も、記者会見もなく、ただのブログ投稿(いくつかのTwitterプロモ動画はあるが)?
他の人も言っているように、OpenAIは特定の契約上の理由から「AGI」モデルを提供するという多大なプレッシャーにさらされていたのではないかと思い始めているが、GPT-6のリリースがこれほど平凡で退屈なものになるとは予想していなかった。
- manlymuppet
実際のモデルについては何も言うことはないが、関係ないことだが、なぜこれらのデモの多くは、人々が自律的に物を買う場面を含んでいるのだろうか?
たとえAIがすべてを正確にやってくれると信頼しても、AIが私の心を読めるわけではない。
普通に、AIなしで食べ物を注文する場合、私はプロセスをもっとコントロールしたいと思うだろう。選択肢や価格を見て、自分が本当に欲しいものを考えること。人は少し考えないと本当に欲しいものがわからないものだ。それなのに、なぜAI企業は、説明があれば十分であるかのように見せるのだろうか?
どれだけの文脈があっても、私が見たことのないものに対する私の反応を正確に予測することはできない。問題は、人々がこれを解決策を必要とする何かとして扱っていることだ。そうではない。AIで私の生活を楽にしたいなら、物事をやりやすくしてくれればいい。私が自分で選ぶことを楽しんでいるものを、あなたに選んでほしいとは思わない。
(また、誰もがAIラボで楽な仕事をしていて、AIが失敗しても30ドルを失わないわけではない。)
- astrobiased
これはフランソワ・ショレの『知能の測定について』(https://arxiv.org/abs/1911.01547) を強く反映しているように思えてならない。
フロンティアモデルの進歩のほとんどは、依然としてスキル獲得の最適化のように見える。より広いベンチマークのカバレッジとパフォーマンス、より多くのドメインがトレーニング分布に吸収され、その表面積内でのパフォーマンスがますます向上している。
それは、カバレッジ主導の能力に関するもののように思える。規模の拡大に伴う過学習にいくぶん類似している。
ショレの枠組みでは、より難しい問いは、システムが真に新しいことを学ぶ効率はどの程度か、ということだ。
現在のAIアーキテクチャとトレーニングを考えると、私たちは真に新しい知能ではなく、スキル獲得の最適化を続けるだけだろう。
- dalemhurley
OpenAIは、より焦点を絞ったことで絶好調だ。Soraなどを中止したことで、無関係な状態からAnthropicと対等な立場にまで成長した。
SolはFable 5よりはるかに優れている。そして、Fable 5.1(非常に印象的だ)の数日後にはAstra(まだ使っていない)が登場する。
CodexはClaude Codeよりわずかに優れている。
サム・アルトマンが基本に立ち返り、OpenAIを立て直したのは良いことだ。
- tristanj
GPT 6 Astraのベンチマーク https://cdn.thenewstack.io/media/2026/09/358eb84a-screenshot...
パフォーマンスはFable 5.1よりも大幅に高い
- datadrivenangel
データサイエンスタスク(内部)にはAstraの時間が含まれていない... データベース移行タスク(内部)も同様... しかしgpt 5.6 solには含まれている... それは面白い。
HealthBench Professionalや他のいくつかも同様だ。
明らかに、OpenAIは非常にずさんであるか、GPT-6 Astraもずさんであるかのどちらかだ。
- jumploops
私が最も興奮しているのは、_ユーザープロンプト_の増加だと思う。
制約が弱い、または曖昧なプロンプトを与えた場合、モデルが左右に仮定を一発で決めつけてほしくない。
Fable/GPT-6のデモは印象的だが、「真のAGI」は、下僕や過剰達成者というよりは、共同作業者のように振る舞うべきだ。
これは正しく実現するのが難しいバランスであり、既存のモデルに追加のプロンプトを付与することで達成可能ではあるが、エージェントは「質問する」モードに傾きすぎることがよくある。
このモデルが適切なバランスを持っているか、少なくともより良いバランスを持っていることを願っている。
- XCSme
面白いが、新しいモデルがリリースされるたびに、クールなものを作りたいという意欲がさらに薄れていく。何の意味があるのか、次のAIが5秒でやってしまうのに。