OpenAI veröffentlicht GPT-6 Astra

OpenAI hat GPT-6 Astra vorgestellt, das neueste Modell seiner KI-Familie. Es verspricht verbesserte Fähigkeiten in den Bereichen Sprachverständnis, Code-Generierung und multimodale Verarbeitung. Der Beitrag auf der offiziellen Website skizziert die wichtigsten Neuerungen und die erwarteten Einsatzmöglichkeiten in Forschung, Produktentwicklung und Unternehmen. Allerdings war die Seite zum Zeitpunkt des Abrufs nicht verfügbar (404), sodass der Inhalt nicht vollständig eingesehen werden konnte.

Die Seite war zum Zeitpunkt des Abrufs nicht verfügbar (404).
  1. dang

    Verwandt: OpenAI beginnt mit der Einführung von GPT-6 Astra - https://news.ycombinator.com/item?id=49554273

    Wie wäre es, wenn wir uns für die Diskussion über die Einführung an diesen Thread halten und diesen für die Diskussion über das Modell nutzen?

  2. intenex

    Die ARC-AGI-3-Bewertung ist extrem irreführend, da dort klar steht, dass „mit [dem Responses-API-]Harness wir schätzen, dass Sol im Bereich von ~30% landen würde.“, aber es zeigt eine Punktzahl von 7,8% für GPT-5.6 Sol, vermutlich weil, wenn sie den Prozentsatz für GPT-5.6 Sol auf die Punktzahl aktualisieren würden, die es mit dem Responses-API-Harness erhalten würde, den sie für GPT-6 Astra verwendet haben, sie dasselbe für den Prozentsatz tun müssten, den sie für Opus 5 zeigen, der ähnlich viel höher wäre.

    Unabhängig davon ist das Ergebnis immer noch gültig, da der ursprüngliche Benchmark-Harness definitiv unangemessen benachteiligt ist, und wenn ein Harness allein dem LLM helfen kann, den Benchmark mit einer fast perfekten Punktzahl zu sättigen, dann muss die Kombination aus beiden immer noch effektiv AGI sein, im Sinne des Bestehens des berühmtesten Benchmarks, der speziell zur Messung des AGI-Fortschritts entwickelt wurde, nach mehreren Iterationen, die ihn progressiv schwerer gemacht haben.

    Ich denke, es ist fair zu sagen, dass dies wahrscheinlich effektiv AGI ist, wenn die Benchmarks auch nur annähernd genau sind - selbst mit Fable bin ich persönlich an dem Punkt angelangt, an dem ich ziemlich zuversichtlich bin, dass es im Wesentlichen nichts gibt, worin ich besser bin als Fable, obwohl ich bei menschlichen Benchmarks allgemein deutlich über dem Durchschnitt liege. Wenn Astra so viel besser ist als Fable, bin ich bereit, hier AGI zu rufen.

    Für die vielen Menschen, die sich dagegen wehren, dass das AGI-Label jemals erreicht werden könnte, wäre ich neugierig zu hören, was euch denken lassen würde, dass Astra noch keine AGI ist, und was noch erreicht werden müsste, damit dies […]

  3. abixb

    Ich möchte einen Schritt zurücktreten: Das ist also GPT-6 – die Veröffentlichung mit natürlicher Zahl, vergleichbar mit GPT-4 und GPT-5 aus den letzten Jahren. Der ARC-AGI-3-Score ist offensichtlich beeindruckend mit 99,9% (wir müssen auf weitere Details warten, wie sie den Response-API-Harness bei GPT-6 Astra verwendet haben, in Bezug auf Reasoning-Erhalt und -Kompaktierung), aber alle anderen Benchmarks scheinen eine relativ bescheidene Verbesserung zu sein, vergleichbar mit jedem der ‚Punkt‘-Updates von KI-Labors.

    Wenn das wirklich AGI ist (je nach Definition von AGI), dann ist das eine sehr langweilige Veröffentlichung eines AGI-Modells. Keine Video-Ankündigung, keine Pressekonferenz, nur ein Blogbeitrag (mit ein paar Twitter-Promo-Videos)?

    Wie andere bereits erwähnt haben, beginne ich zu denken, dass OpenAI unter immensem Druck stand, ein ‚AGI‘-Modell aus bestimmten vertraglichen Gründen zu liefern, aber ich hätte nie erwartet, dass die GPT-6-Veröffentlichung so alltäglich und banal sein würde.

  4. manlymuppet

    Ich habe nichts über das eigentliche Modell zu sagen, aber unabhängig davon – warum beinhalten so viele dieser Demos Menschen, die autonom Dinge kaufen?

    Selbst wenn ich einer KI vertrauen würde, alles richtig zu machen, kann die KI nicht meine Gedanken lesen.

    Wenn ich normal und ohne KI Essen bestellen würde, hätte ich gerne mehr Kontrolle über den Prozess – die Optionen ansehen, Preise, darüber nachdenken, was ich wirklich will. Menschen wissen nicht, was sie wirklich wollen, bis sie ein wenig darüber nachgedacht haben. Warum tun KI-Unternehmen also so, als ob eine Beschreibung alles wäre, was benötigt wird?

    All der Kontext der Welt kann nicht genau vorhersagen, wie ich auf Dinge reagiere, die ich nicht gesehen habe. Das Problem ist, dass die Leute dies wie etwas behandeln, das eine Lösung braucht. Das tut es nicht. Wenn du mir das Leben mit KI erleichtern willst, mach es einfach einfacher, Dinge zu tun. Ich möchte nicht, dass du Dinge für mich aussuchst, die ich aktiv selbst aussuche.

    (Außerdem hat nicht jeder einen gut bezahlten Job in einem KI-Labor, der dafür sorgt, dass man 30 Dollar nicht vermisst, wenn die KI Mist baut haha.)

  5. astrobiased

    Ich kann nicht anders, als zu bemerken, wie sehr dies François Cholets On the Measure of Intelligence widerspiegelt: https://arxiv.org/abs/1911.01547

    Der meiste Fortschritt bei Grenzmodellen sieht immer noch wie Optimierung des Kompetenzerwerbs aus: breitere Benchmark-Abdeckung und Leistung, mehr Domänen, die in die Trainingsverteilung aufgenommen werden, und zunehmend stärkere Leistung innerhalb dieser Oberfläche.

    Es scheint mehr um abdeckungsgetriebene Kompetenz zu gehen. Etwas analog zu Overfitting in großem Maßstab.

    Die schwierigere Frage, in Cholets Rahmen, ist: Wie effizient kann ein System lernen, etwas wirklich Neues zu tun?

    Mit unseren aktuellen KI-Architekturen und dem Training, das wir haben, denke ich, dass wir nur mit der Optimierung des Kompetenzerwerbs fortfahren werden, anstatt mit wirklich neuartiger Intelligenz.

  6. dalemhurley

    OpenAI ist jetzt stark, wo sie fokussierter sind. Das Einstellen von Projekten wie Sora et al. hat dazu geführt, dass sie von irrelevant zu auf Augenhöhe mit Anthropic sind.

    Sol ist so viel besser als Fable 5. Dann bekommen wir Astra (noch nicht benutzt) wenige Tage nach Fable 5.1 (was sehr beeindruckend ist).

    Codex ist etwas besser als Claude Code.

    Gut für Sam Altman, dass er zu den Grundlagen zurückgekehrt ist und OpenAI gedreht hat.

  7. tristanj

    GPT-6-Astra-Benchmarks https://cdn.thenewstack.io/media/2026/09/358eb84a-screenshot...

    Die Leistung ist deutlich höher als bei Fable 5.1

    Quelle: https://thenewstack.io/openai-gpt6-astra-benchmarks/

  8. jumploops

    Ich denke, das, worauf ich mich am meisten freue, ist die Zunahme an _Nutzer-Prompting_.

    Wenn ich einen schlecht eingeschränkten/mehrdeutigen Prompt gebe, möchte ich nicht, dass das Modell links und rechts Annahmen trifft.

    Die Demos von Fable/GPT-6 sind beeindruckend, aber „echte AGI“ sollte eher wie ein Kollaborateur handeln als wie ein Untergebener oder Überflieger.

    Es ist eine schwierige Balance, und obwohl dies mit zusätzlichem Prompting bei bestehenden Modellen möglich war, stelle ich fest, dass die Agenten oft zu sehr in den „Fragen stellen“-Modus verfallen.

    Hoffentlich hat dieses Modell die richtige Balance, oder zumindest eine bessere?

  9. datadrivenangel

    Data-Science-Aufgaben (Intern) beinhalten keine Zeit für Astra... dasselbe für Datenbankmigrationsaufgaben (Intern)... Aber für GPT-5.6 Sol... was lustig ist.

    Gleiches für HealthBench Professional und ein paar andere.

    Offensichtlich ist entweder OpenAI sehr schlampig oder GPT-6 Astra ist auch schlampig.

  10. XCSme

    Es macht Spaß, aber jede neue Modellveröffentlichung macht mich noch weniger interessiert daran, coole Sachen zu erstellen. Was ist der Punkt, wenn die nächste KI es in 5 Sekunden machen kann?

Mehr von diesem Tag

2026-09-03