Nvidia AVO erzielt 100 % im ARC-AGI-3-Benchmark
Nvidia AVO scores 100% on the ARC-AGI-3 interactive reasoning benchmark
Nvidia meldet, dass sein Coding-Agent AVO im ARC-AGI-3-Benchmark 100 % erreicht hat. AVO absolvierte alle 183 Level in 25 öffentlichen Umgebungen, ohne Anweisungen, explizite Regeln oder vorgegebene Ziele. Das System nutzt kontinuierliche Inspektion, Planung, Umsetzung und Bewertung mit Gedächtnis und Feedback.
AVO absolvierte alle 183 Level in allen 25 öffentlichen Umgebungen und fand heraus, was zu tun ist, ohne Anweisungen, explizite Regeln oder vorgegebene Ziele.
- mellosouls
Der zugrunde liegende Artikel sollte der Link sein:
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...
Dort findet man den äußerst wichtigen Zusatz, dass es sich um den öffentlichen Satz handelt, nicht um den privaten Satz (mit dem Risiko von Overfitting, d.h. die Ergebnisse wiederholen sich nicht, wenn sie zum Wettbewerb eingereicht werden), sowie das Detail, dass dies im Wesentlichen ein Harness ist, das zu Opus 5 hinzugefügt wurde, nicht Nvidias eigene Modelle.
Offensichtlich trotzdem beeindruckend, würde man meinen.
- woeirua
Ich dachte, ARC-AGI-3 sei explizit ein Test der rohen Modellleistung ohne das Harness? Das Hinzufügen des Harness sagt uns nichts Neues. Wir wissen seit langem, dass Agenten mit ausreichenden Harnesses zu langfristigem Denken in der Lage sind. GPT-4(?) war vor 18 Monaten in der Lage, Pokemon zu schlagen, aber Modelle wurden erst in den letzten sechs Monaten in der Lage, es ohne Harness zu schlagen...?
- antinucleon
Der Autor des AVO-Papers (ehemaliger NVIDIA-Mitarbeiter) ist hier. Diese Arbeit wurde vor einem halben Jahr für GPU-Kernel durchgeführt, und derselbe Ansatz wurde nun auf ARC-AGI-3 angewendet. Ich denke, die Leute unterschätzen immer noch den Evolutionsfortschritt; z.B. haben wir kürzlich einen selbstverbessernden Evolutions-Harness entwickelt, der einen gesamten Inferenz-Stack generiert und bei verschiedenen Aufgaben besser ist als SGLang/vLLM: https://int21.ai/insights/addressing-the-inference-bottlenec...
- subzel0
Die 100%-Punktzahl wurde auf dem 25er-öffentlichen Satz erreicht, nicht auf den halbprivaten oder privaten Sätzen.
- magicalhippo
Der Blogbeitrag: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-...
Verwendet Claude Opus 5, kann aber auch andere verwenden:
AVO ist auch darauf ausgelegt, mit Frontier-Modellen zu arbeiten. Während unser vollständiges Ergebnis auf dem öffentlichen Satz Claude Opus 5 verwendete, haben wir AVO zusätzlich mit GPT-5.6 Sol auf einer anspruchsvollen Teilmenge von Spielen gekoppelt. In diesen begrenzten Experimenten erreichte Sol in mehreren Fällen die erreichten Level schneller in Wanduhrzeit, während Opus bei Vergleichen auf gleichem Level weniger Umgebungsaktionen verwendete. Diese vorläufigen Ergebnisse deuten auf komplementäre Betriebsprofile über Modelle hinweg hin, und wir überlassen einen breiteren systematischen Vergleich zukünftiger Arbeit.