ProgramBench Vetted: KI-Agenten scheitern beim Reengineering von Binärdateien

ProgramBench Vetted: Reverse Engineering from a Runnable Binary

ProgramBench Vetted: KI-Agenten scheitern beim Reengineering von Binärdateien

ProgramBench Vetted ist ein neuer Benchmark mit 50 Aufgaben, bei dem KI-Agenten ausführbare Binärdateien rekonstruieren müssen. Im Gegensatz zum ursprünglichen ProgramBench von Meta wurden die Aufgaben mit speziellen Prüfungen gegen Test-Duplikate, Umgebungslecks und Reward-Hacks abgesichert. Die Ergebnisse zeigen, dass selbst die besten Modelle wie Claude Opus 5 nur 14 % der Aufgaben vollständig lösen. Der Benchmark ist besonders wertvoll für die Erforschung von Langzeit-Koordination und Reinforcement Learning mit dichten Belohnungen.

Frühere Exposition gegenüber den Quellcodes bedeutet nicht, dass ein Modell die Implementierung aus dem Gedächtnis rekonstruieren kann – der Reversal Curse bietet eine nützliche Analogie für diese Lücke.

Mehr von diesem Tag

2026-08-22