OpenAI의 GPT-6 Astra 공식 페이지가 404 오류를 반환하다
OpenAI의 GPT-6 Astra 공식 발표 페이지가 접속 시 404 오류를 반환하며, 페이지가 존재하지 않음을 알리고 있다. 해당 URL은 'https://openai.com/index/gpt-6-astra/'로, 현재 접근이 불가능한 상태다. 이는 OpenAI의 차세대 모델에 대한 기대감을 높이는 동시에, 공식 정보를 기다리는 사용자들에게 혼란을 주고 있다.
Signal drifts past Mars / Ground lights wait with steady hands / Stars answer in time
HN 토론
983- dang
관련: OpenAI가 GPT-6 Astra의 단계적 출시를 시작했습니다 - https://news.ycombinator.com/item?id=49554273
출시에 대한 이야기는 그 게시물에서, 모델에 대한 이야기는 이 게시물에서 하는 게 어떨까요?
- intenex
ARC-AGI-3 점수표는 매우 오해의 소지가 있습니다. 자체적으로 'responses API 하네스 사용 시 Sol은 약 30% 정도의 점수를 받을 것으로 추정한다'고 명시해 놓고, GPT-5.6 Sol의 점수를 7.8%로 표시하기 때문입니다. 아마도 GPT-5.6 Sol의 점수를 GPT-6 Astra에 사용한 responses API 하네스로 측정한 점수로 업데이트한다면, Opus 5에 표시된 점수도 마찬가지로 훨씬 높아져야 하기 때문에 그렇게 한 것으로 보입니다.
어쨌든 결과는 여전히 유효합니다. 원래의 벤치마크 하네스는 분명히 비합리적으로 불리하게 설계되어 있고, 하네스만으로 LLM이 거의 완벽한 점수로 벤치마크를 포화시킬 수 있다면, 둘의 조합은 AGI 진행 상황을 측정하기 위해 특별히 설계된 가장 유명한 벤치마크를 통과한다는 의미에서 사실상 AGI라고 볼 수 있기 때문입니다. 여러 차례에 걸쳐 점점 더 어렵게 만든 후에도 말이죠.
벤치마크가 대략적으로 정확하다면 이것이 사실상 AGI라고 말하는 것이 공정하다고 생각합니다. Fable조차도 저는 개인적으로 인간 기준으로 평균 이상임에도 불구하고 Fable보다 내가 더 잘하는 것이 본질적으로 없다고 합리적으로 확신하는 지점에 도달했습니다. Astra가 Fable보다 이렇게 훨씬 낫다면, 저는 여기서 AGI라고 부를 준비가 되었습니다.
AGI라는 꼬리표가 달성될 수 있다는 것에 저항하는 많은 사람들에게, Astra가 아직 AGI가 아니라고 생각하게 만드는 것이 무엇인지, 그리고 이를 위해 아직 무엇이 달성되어야 하는지에 대한 의견을 듣고 싶습니다.
- abixb
한 발 물러서서 생각해 보겠습니다: 이것은 GPT-6입니다. 지난 몇 년간의 GPT-4, GPT-5와 비교할 수 있는 자연수 버전 릴리스입니다. ARC-AGI-3 점수는 99.9%로 분명히 인상적이지만(추론 유지 및 압축과 관련하여 GPT-6 Astra에 responses API 하네스를 어떻게 사용했는지에 대한 자세한 내용은 기다려야 합니다), 다른 모든 벤치마크는 AI 연구소의 '포인트' 업데이트와 비교할 수 있는 비교적 완만한 개선으로 보입니다.
이것이 진정한 AGI라면(여전히 AGI의 정의에 따라 다르지만), 이것은 매우 지루한 AGI 모델 릴리스입니다. 비디오 발표도, 기자 회견도 없고, 그저 블로그 게시물(약간의 트위터 홍보 비디오 포함)뿐입니까?
다른 사람들이 언급했듯이, 저는 OpenAI가 특정 계약상의 이유로 'AGI' 모델을 제공해야 한다는 엄청난 압박을 받고 있다고 생각하기 시작했습니다. 하지만 GPT-6 릴리스가 이렇게 평범하고 진부할 줄은 예상하지 못했습니다.
- manlymuppet
실제 모델에 대해서는 할 말이 없지만, 관련 없는 질문입니다. 왜 이렇게 많은 데모에 사람들이 자율적으로 물건을 사는 장면이 포함되어 있을까요?
AI가 모든 것을 정확히 처리할 것이라고 믿는다고 해도, AI가 내 마음을 읽을 수는 없잖아요.
평소에 AI 없이 음식을 주문한다면, 저는 그 과정을 더 통제하고 싶을 것입니다. 옵션, 가격을 살펴보고, 내가 정말 원하는 것이 무엇인지 생각해 보는 것 말이죠. 사람들은 잠시 생각해 보기 전에는 자신이 정말 원하는 것이 무엇인지 모릅니다. 그렇다면 왜 AI 회사들은 설명만으로 충분하다는 듯이 보이게 할까요?
세상의 모든 맥락이 내가 보지 못한 것에 대해 어떻게 반응할지 정확히 예측할 수는 없습니다. 문제는 사람들이 이것을 해결해야 할 문제로 취급한다는 것입니다. 그렇지 않습니다. AI로 내 삶을 더 쉽게 만들고 싶다면, 그냥 일을 더 쉽게 하도록 만들어 주세요. 내가 직접 고르는 것을 즐기는 것을 당신이 골라 주는 것을 원하지 않습니다.
(또한 모든 사람이 AI 실수가 $30 손해를 봐도 아깝지 않은 안락한 AI 연구소 직업을 가진 것은 아니라는 점을 명심하세요.)
- astrobiased
이것이 Francois Chollet의 '지능의 측정에 관하여' (https://arxiv.org/abs/1911.01547)와 얼마나 닮았는지 눈치채지 않을 수 없습니다.
프론티어 모델의 발전 대부분은 여전히 기술 습득 최적화처럼 보입니다: 더 넓은 벤치마크 적용 범위와 성능, 훈련 분포에 흡수되는 더 많은 도메인, 그리고 그 표면 영역 내에서 점점 더 강력한 성능.
이는 적용 범위 주도 역량에 더 가까워 보입니다. 대규모 과적합과 다소 유사합니다.
Chollet의 프레임워크에서 더 어려운 질문은: 시스템이 진정으로 새로운 것을 배우는 데 얼마나 효율적일 수 있는가입니다.
현재의 AI 아키텍처와 훈련 방식을 고려할 때, 우리는 진정으로 새로운 지능보다는 기술 습득 최적화만 계속할 것이라고 생각합니다.
- dalemhurley
OpenAI는 이제 더 집중하게 되면서 잘해 나가고 있습니다. Sora 등의 프로젝트를 중단하면서 Anthropic과 대등한 수준으로 올라선 것을 볼 수 있습니다.
Sol은 Fable 5보다 훨씬 낫습니다. 그리고 Fable 5.1(매우 인상적임)이 나온 지 며칠 만에 Astra(아직 사용해 보지 못함)가 나옵니다.
Codex는 Claude Code보다 약간 낫습니다.
Sam Altman이 기본으로 돌아가 OpenAI를 반전시킨 것은 잘한 일입니다.
- tristanj
GPT 6 Astra 벤치마크 https://cdn.thenewstack.io/media/2026/09/358eb84a-screenshot...
성능이 Fable 5.1보다 상당히 높습니다.
- jumploops
제가 가장 기대하는 것은 _사용자 프롬프트_의 증가입니다.
제약이 약하거나 모호한 프롬프트를 주면, 모델이 여기저기서 가정을 한 번에 쏟아내는 것을 원하지 않습니다.
Fable/GPT-6의 데모는 인상적이지만, '진정한 AGI'는 하인이나 과잉 성취자라기보다는 협력자처럼 행동해야 합니다.
이것은 맞추기 어려운 균형이며, 기존 모델에 추가 프롬프트를 통해 이를 달성하는 것이 가능했지만, 에이전트가 '질문하기' 모드에 너무 치우치는 경우가 많다는 것을 발견했습니다.
이 모델이 적절한 균형을 가지고 있기를, 또는 적어도 더 나아지기를 바랍니다?
- datadrivenangel
데이터 과학 작업(내부)에는 Astra 시간이 포함되어 있지 않습니다... 데이터베이스 마이그레이션 작업(내부)도 마찬가지입니다... 하지만 gpt 5.6 sol에는 포함되어 있습니다... 웃기네요.
HealthBench Professional 및 몇몇 다른 작업도 마찬가지입니다.
OpenAI가 매우 엉성하거나 GPT-6 Astra도 엉성하다는 것이 분명합니다.
- XCSme
재미있긴 한데, 새로운 모델이 나올 때마다 멋진 것을 만들고 싶은 마음이 점점 줄어듭니다. 다음 AI가 5초 만에 해낼 수 있는데, 뭐 하러 만들까요?