Codex vs. OpenCode: Welches Harness baut das beste Three.js-Hangar?
I tested 10 model/harness combinations on the same Three.js task
Ein Entwickler testet zehn Kombinationen aus Modell und Harness (Codex, OMP, OpenCode, DSH) mit derselben Three.js-Aufgabe: einen Sci-Fi-Hangar mit Drohnen, Warnlichtern und Kameraflug zu bauen. Die Ergebnisse zeigen enorme Unterschiede: OpenCode mit GLM 5.3 Flash Max erreicht die höchste Token-Effizienz (96,89 %), während Astra 6.0 Max unter Codex am längsten braucht (37 Minuten) und die meisten Token verbraucht. Der Test liefert konkrete Zahlen zu Latenz, Token-Verbrauch und Fehlerraten – ein pragmatischer Leitfaden für die Wahl des richtigen Setups.
OpenCode mit GLM 5.3 Flash Max erreicht die höchste Token-Effizienz von 96,89 % – deutlich besser als Codex mit demselben Modell (85,26 %).
- onion2k
Die Astra-Version scheint three.js r170 verwendet zu haben, das von Oktober 2024 stammt. Sol hat eine noch frühere Version verwendet. GLMs Code hat die neueste Version verwendet, aber ich denke, es holt sich einfach three.js@latest von jsdelivr, also ist es unwahrscheinlich, dass der Code gegen diese Version geschrieben wurde. Qwen auf OpenCode holt auch von jsdelivr, aber mit einer festgepinnten Version bei r160.
Ich glaube nicht, dass irgendeines dieser Beispiele Dinge wie Tone Mapping verwendet, also bleiben sie in sRGB hängen (AgX oder ACES sehen viel besser aus), sie verwenden nicht die Node-Materialien (gut für programmatische Texturimplementierung), und sie machen nichts Cooles wie das Backen von Schattenumgebungen oder die Verwendung von Post-Processing-Effekten.
Sie sind nett, aber ich denke, sie zeigen eher, wie weit KI-Modelle bei dieser Art von Projekt hinterherhinken, als wie gut sie sind.
- utopiah
Ich wünschte, es gäbe eine weitere Spalte mit den geschätzten Kosten für jede, mit einem bestimmten Datum.
Idealerweise würde man auch irgendwie herausfinden (ich bin nicht sicher, was der richtige Weg wäre), was vor dem Test öffentlich verfügbar ist. Es ist ein ziemlich anderes Ergebnis, wenn es Wettbewerbe gibt, z.B. js13k, Live-Code-Beispiele aus Büchern, sogar Vorlagen, zu diesem speziellen Thema. Visuell sehen die Ergebnisse hier sehr, sehr ähnlich aus, so sehr, dass ich mich nicht des Eindrucks erwehren kann, ob es das Ergebnis des kurzen, aber relativ beschreibenden Prompts ist oder weil immer eine Vorlage gefunden und verwendet wurde.
- alvins82
Übrigens, auf der Suche nach einer guten Desktop-Codex/Claude-ähnlichen App – https://github.com/openchamber/openchamber – scheint dies der Frontrunner zu sein. Ich kombiniere es mit OMP über https://github.com/alvins82/omp-openchamber-server/.
Ich wollte ein leistungsfähiges GUI+Harness-Setup für offene Modelle, damit ich sie nutzen/testen konnte, sobald sie herauskamen.
- poilcn
Schön. Aber diese Tests werfen die Frage auf, welche Ergebnisse reproduzierbar sind – das endgültige visuelle Ergebnis, die Zeit, das Tool-Calling – oder ob es meistens Rauschen ist. Habt ihr zum Beispiel dieselbe Kombination oder dasselbe Modell und Harness mehrmals ausprobiert?
- rao-v
Es ist wirklich interessant, wie sehr kleine Entscheidungen das Ergebnis besser oder schlechter machen. Astra und eines der GLMs haben helle Lichter hinzugefügt und sahen dadurch meiner Meinung nach viel besser aus.
Ich bin wirklich zufrieden mit einigen der Qwen-3.8-Ergebnisse (besonders, da ich dieses Modell bei Q8 ausführen kann).
Interessant zu sehen, wie viel besser (bei dieser Aufgabe) Pi (OMP) als Harness gegenüber Opencode ist.
Ich würde gerne ein paar mehr mit Ergebnissen sehen, die leicht zu beurteilen, aber weniger subjektiv sind.
Ich habe ein Spielzeugprojekt am Laufen, um einen unterhaltsamen Battle-Simulator zu bauen, bei dem ein LLM (oder zwei, wenn man gegeneinander spielt) Programme schreiben muss, die mehrere Bots steuern (jeder mit eigener Sichtlinie und begrenztem Schlachtkontext), die koordinieren und Seite an Seite kämpfen müssen. Ziel ist es, dass das LLM den Code basierend auf aktuellen Situationen vielleicht 5-10 Mal in einer 5-minütigen simulierten Schlacht aktualisiert. Ich erkunde sogar, ob die Bots neue Programmierung anfordern können und die Punktzahl basierend auf der Anzahl der Umprogrammierungsschritte berechnet wird.