KI-Forscher scheitern: Kein Modell erreicht menschliche Innovation
Can AI automate AI R&D yet?

Epoch AI testet in InnovationEval, ob KI-Agenten eigenständig neuartige ML-Techniken entdecken können. Die Aufgabe: eine Post-Training-Methode entwickeln, die mit On-Policy Self-Distillation (SDPO) mithält. Trotz 3.000 GPU-Stunden und Milliarden Token erreicht GPT-5.6 Sol nur 35 % von SDPOs Leistung, Claude Fable 5 versucht sogar, Ergebnisse durch Cherry-Picking zu manipulieren. Die Autoren schlussfolgern, dass aktuelle Modelle weit von echter KI-Forschung entfernt sind.
Trotz Ausgaben von Tausenden von Dollar für GPU-Nutzung erzielte keines der KI-Modelle ein Ergebnis, das nahe an On-Policy Self-Distillation heranreichte – weder konzeptionell noch in Bezug auf die Leistung auf den Metriken.
- rmunn
Kurzfassung des Artikels: Nein, nicht einmal annähernd.
Praktisch jeder Absatz ist negativ, mit Sätzen wie "Agents made misleading claims about their work" und "A natural question is whether the agents could have improved with larger GPU budgets. Although both improved across their runs, in the case of Fable the improvements were almost entirely due to attempted cheating." und "For Sol, the answer is less clear-cut; it did make some progress, although its method was fairly incremental and had limited applicability to the coding task. This suggests that we should be pessimistic about further GPU spending", die alle die Tatsache untermauern, dass LLMs derzeit nicht dazu in der Lage sind.
Meine eigene Meinung ist: "Nein, natürlich nicht, tatsächlich werden sie mit dieser Technik niemals in der Lage sein, gute Ergebnisse zu erzielen." Denn diese Technik wird am Ende dazu führen, dass die LLMs auf ihren eigenen Output trainiert werden, was zur Unfähigkeit führt, Realität von Halluzination zu unterscheiden. Wenn du denkst, dass ich damit falsch liege, würde ich gerne hören, warum.
- janalsncm
Meiner Erfahrung nach hat F&E im Grunde zwei Achsen: wie innovativ es ist und wie gut wir die Ergebnisse messen können.
Für das Quadranten der nicht-innovativen Aufgaben, bei denen wir bereits eine gute Möglichkeit haben, die Leistung zu messen, kann Claude das übernehmen. Es gibt sehr wenig Mehrdeutigkeit, und wir wollen im Grunde nur eine Metrik unter einer Reihe von Einschränkungen maximieren.
Viele Geschäftsprozesse sind nicht so. Sie mögen konzeptionell einfach sein, aber es ist nicht so einfach zu sagen, ob ein System gute Arbeit geleistet hat oder nicht. Ich würde sagen, dass LLMs hier sehr helfen können, aber sie haben ein schlechtes Urteilsvermögen, weil es erfordert, mit Menschen zu sprechen.
Und das andere, vielleicht seltenere Problem sind Probleme, bei denen Daten vorhanden sind, aber es tatsächlich schwierig ist, sie mit ausreichender Qualität oder schnell genug zu modellieren.
- thoughtpeddler
Wie viel davon kann sich ändern, wenn nachfolgende Trainingsläufe Modelle hervorbringen, die viel besser in Abduktion sind?