Opus 5.5 arbeitet stundenlang allein – so steuerst du es

Getting the most out of Opus 5.5 in Claude and Claude Code

Opus 5.5 arbeitet stundenlang allein – so steuerst du es

Opus 5.5 denkt vor jeder Antwort selbstständig nach und arbeitet deutlich länger eigenständig als frühere Modelle. Der Leitfaden zeigt, wie man den ganzen Auftrag in einer Nachricht übergibt, eine klare Ziellinie definiert und unnötige „think carefully“-Zeilen streicht. Für lange Läufe in Claude Code helfen Regeln in der CLAUDE.md, Subagenten für Audits und eine Aufgabenliste in einer Datei. Zum Schluss prüft man zuerst, was das Modell vom Nutzer braucht.

Ein früher Tester sagte, Opus 5.5 habe mit geringstem Aufwand mehr Bugs gefunden als Opus 5 mit hohem Aufwand – und das mit weniger Fehlalarmen.
  1. rdli

    Es ist ein wirklich gutes Modell. In den letzten Tagen habe ich Opus ein paar allgemeine Anweisungen gegeben, um im Grunde unsere CI zu beschleunigen, und ihm gesagt, dass mir sowohl Abrechnungsminuten als auch Wanduhrzeit wichtig sind. Ich habe ihm gesagt, es soll einen Plan erstellen, nachdem es alles in unserer CI analysiert hat, den Plan von einem Fable-Subagenten prüfen lassen und sich dann auf Änderungen mit geringem Risiko und hohem Nutzen konzentrieren.

    9 Stunden später hatte ich 12 PRs bereit zum Mergen, und das Nettoergebnis ist, dass die CI-Zeit von ~10 Minuten auf ~4 Minuten gesunken ist und die Abrechnungsminuten um etwa 60 % zurückgegangen sind. Weniger als eine Stunde meiner Aufmerksamkeit.

  2. jjcm

    Es ist extrem gut im Frontend, besonders wenn es eine Bildreferenz hat. Ich habe Design-Referenzbilder hineingeworfen und ihm gesagt, es soll sich auf die fließenden SVGs konzentrieren, und es hat dieses von Star-Trek-Computern inspirierte Layout zertrümmert: https://html.non.io/lcars-opus-5.5

  3. pawelduda

    Ich habe Opus 5.5 xhigh auf einen Bauplan für ein Haus (PDF mit Vektorzeichnungen) angesetzt und es gebeten, sein 3D-Modell in Blender zu erstellen. Es hat die Aufgabe in 45 Minuten mit einem Schuss erledigt und meine manuelle Arbeit (Blender-Neuling) von über 50 Stunden übertroffen. Es hat auch dieselben Probleme mit dem Dokument markiert, die mir vorher aufgefallen waren. Ich hatte einige Renderings und Pläne von einem Innenarchitekten und habe dann darum gebeten, sie zusammenzuführen. Es hat den Job gemeistert. 45 $ gesamte API-Kosten (ich bin in einem Plan, also hat es mich viel weniger gekostet, ich poste nur, was /usage anzeigt). Verrücktes Upgrade.

    Ich habe vor etwa einem halben Jahr die Machbarkeit einer solchen Aufgabe untersucht und bin zu dem Schluss gekommen, dass KI nicht über ausreichendes räumliches Wissen und Bauplanwissen verfügen würde, es sei denn, man wäre bereit, unvernünftig viel Geld in die Aufgabe zu stecken.

  4. adastra22

    Einige dieser Ratschläge gehen wirklich am Ziel vorbei. Ich werde nur zu einem sprechen, den ich gut kenne. Viele meiner häufig verwendeten Prompts enthalten „denk das Schritt für Schritt durch“, denn wenn man das nicht tut, betrachtet es die Aufgabe nur ganzheitlich statt Schritt für Schritt, und in diesem Denkrahmen tauchen andere Probleme auf. Ich sehe das. Oft bemerkt es beispielsweise beim Planen keine Interdependenzen zwischen Aufgaben, bis man es zwingt, das Ganze Schritt für Schritt (Aufgabe für Aufgabe) durchzudenken; dann bemerkt es, dass Schritt 2 ein Feature erfordert, das in Schritt 14 eingeführt wird. Sonst würde es das nicht bemerken.

    Ja, das hat sich bei Opus 5.5 bewahrheitet. Ich habe es überprüft. Es ist ein massiv besseres Modell, ebenbürtig mit Fable, aber mit anderen Stärken und Schwächen. Aber es hat immer noch dieses Problem. Was fairerweise auch auf Menschen zutrifft. Planung ist eine erlernte Fähigkeit.

    Ich denke, was sie sagen, ist, dass das Harness nicht mehr eine Textsuche nach „think“ verwendet, um Reasoning-Modi zu aktivieren. Fair, das ist gut zu wissen. Das bedeutet aber nicht, dass das Bitten des Modells, auf eine bestimmte Weise zu denken, nicht den beabsichtigten Effekt hat.

  5. hibikir

    Es ist viel besser als 5, aber ich hatte diese Woche ein paar Situationen, in denen es zu sehr daran interessiert war, unabhängig zu sein, und Entscheidungen traf, die direkt gegen meine Empfehlungen gingen. Es kann auch lustige Dinge tun, wie den Auto-Modus davon zu überzeugen, weit über das hinauszugehen, was ich autorisiert habe. Zum Beispiel wurde eine spezifische Erlaubnis, Prozess X in Region abz-1 auszuführen, plötzlich zu X in 5 anderen Regionen, ohne Warnung, und es machte Änderungen, die es in den Zusammenfassungen nie erwähnte. Und ein paar Mal lag es bei den Entscheidungen völlig falsch, weil es annahm, Systeme zu verstehen, die es nicht verstand. Es diskutierte sogar mit mir, als ich es korrigierte, weil es annahm, ähnliche Namen würden sich auf dasselbe beziehen, obwohl sie es nicht taten.

    Also, es zu bitten, Dinge lange Zeit allein zu erledigen? Angesichts der letzten Woche: absolut nicht.

  6. jampekka

    Was ist das für ein Spam generischer Kommentare darüber, wie großartig Opus 5.5 ist, mit vielleicht einer Anekdote? Wie ist das eine Diskussion der Einreichung?

  7. magicalhippo

    Ich war von meinem jüngsten Projekt sehr beeindruckt. Ich wollte einige ältere Elektronikschaltungen simulieren. Ich habe ihm einen Ordner mit Scans alter Servicehandbücher gegeben, die Schaltpläne enthielten. Es schaffte es, die Schaltungen korrekt zu interpretieren, einschließlich herauszufinden, dass einige dieselbe Topologie hatten, obwohl die Diagramme recht unterschiedlich waren, oder dass einige subtile, aber sehr wichtige Unterschiede aufwiesen, obwohl sie auf den ersten Blick fast identisch aussahen.

    In einigen Fällen bat es mich, bestimmte Teilschaltungen und einige Komponentenwerte zu überprüfen, weil es sie nicht richtig lesen konnte. Also erfand es nicht einfach etwas, sondern wandte sich an mich.

    Es führte dabei auch jede Menge kleine Simulationsexperimente durch, um Behauptungen aus dem Servicehandbuch zu verifizieren, etwa dass der RC-Filter, den es aus den Schaltplänen abgelesen hatte, tatsächlich eine Grenzfrequenz hatte, die in Bezug auf eine Bandbreitenzahl im Handbuch sinnvoll war.

    Ich hatte Datenblatt-PDFs für viele der ICs hochgeladen, und es nutzte diese zum Gegenprüfen und Validieren.

    Es arbeitete über eine Stunde lang weiter. Als es um die manuelle Verifikation bat, beschrieb ich Schaltungsverbindungen in Worten, etwa „von Pin 3 an IC 2 gibt es einen Serienwiderstand von 3k parallel zu einem 10-pF-Kondensator, dann verbindet es sich mit einem 18k-Widerstand gegen Masse, einer sperrgepolten Diode gegen Masse und schließlich in Pin 6 von IC 4“, und es verstand die Topologie in allen Fällen korrekt. Manchmal bat es mich, erneut zu prüfen, weil es dachte, etwas stimme nicht, und tatsächlich hatte ich die Schaltpläne falsch gelesen.

    Ich habe außerdem […]

  8. ToJans

    In der Tat ein hervorragendes Modell.

    Ich habe ihm einige große Aufgaben gegeben und es gebeten, so weit wie möglich zu parallelisieren usw.

    Es hat meine wöchentlichen Tokens in etwa einem Tag durchgebrannt (20x max), aber die Ausgabe war völlig auf den Punkt.

    (Ich wusste, dass es in meinem Konto einen Button „reset token usage - opus 5.5“ gab.)

    Ich bin jetzt an einem Punkt, an dem ich ihm sogar meine Entdeckung neuer Features delegiere.

    Man muss ihm allerdings immer noch Methodologien vorgeben, um die richtige Ausgabe zu bekommen, aber das Ergebnis geht weit über das hinaus, was ich mit einem Team von 5 in einem Monat realisieren könnte.

Mehr von diesem Tag

2026-10-03