Antigravity 2.0 dominiert den OpenSCAD Architektur-LLM-Benchmark mit dem Pantheon
Antigravity 2.0 Tops the OpenSCAD Architectural 3D LLM Benchmark

Wir haben verschiedene KI-Coding-Tools getestet, indem wir sie aufforderten, das Pantheon in OpenSCAD zu modellieren. Während einfache Syntax-Tests leicht sind, erfordern komplexe architektonische Strukturen echtes räumliches Verständnis. Google Antigravity 2.0 lieferte das beste autonome Ergebnis, inklusive der charakteristischen Kassettendecke, und zeigte, wie gut LLMs parametrische CAD-Code aus visuellen Referenzen generieren können.
OpenSCAD ist kein Werkzeug zum Formen organischer Oberflächen, sondern glänzt bei konstruktiven Formen, radialer Symmetrie und sauberen geometrischen Operationen.
- jhot
Letztes Wochenende habe ich meiner Frau ein Fahrrad auf Marketplace gekauft. Es war in gutem Zustand, fehlte aber einer der Dichtungen für die interne Kabelverlegung. Ich habe Claude Fotos des pillenförmigen Lochs allein sowie mit meinem digitalen Schieblehrmaß in der langen und kurzen Richtung geschickt.
Ich habe ihm einen kurzen Prompt gegeben, und er hat mir ein OpenSCAD-Modell geliefert, bei dem alles parametrisiert war. Ich habe es ohne Änderungen in TPU gedruckt, und es war beim ersten Versuch fast perfekt. Claude hatte eine Subtraktion von 0,3 mm in den X/Y-Abmessungen eingebaut, und ich habe sie auf 0,1 mm reduziert – jetzt ist es perfekt.
Eine viel einfachere Form als antike römische Architektur, aber trotzdem sehr cool, wie einfach das war.
- mellosouls
Antigravity mag vielleicht den jeweiligen Benchmark anführen, aber:
Mein Antigravity (erzwungener) Ersatz für Gemini CLI erfordert, dass ich mich jedes Mal über den Browser einlogge, wenn ich ihn benutze, und meine Antigravity IDE aktualisiert sich überhaupt nicht. Also:
Wenn es in Ordnung ist, würde ich bevorzugen, dass sie sich darauf konzentrieren, eine akzeptable Basisversion zu erreichen, bevor sie sich darum kümmern, bei irgendetwas die Nummer eins zu sein.
Ps: Tatsächlicher Titel:
OpenSCAD LLM Benchmark: Der Bau des Pantheons
- jlhawn
> Antigravity war der einzige autonome Agent, der das charakteristische Innenraumdeckenmuster des Pantheons umgesetzt hat: wiederholte quadratische Kassettendekorationen, die durch das Oculus sichtbar sind.
Das ist wirklich beeindruckend. Ich habe mir das 3D-Modell angesehen und hatte vor dem Lesen davon nicht einmal daran gedacht, INSIDE das Gebäude zu schauen.
Hier ist [1] das 3D-Modell mit aktiviertem `show_cutaway`.
[1] https://modelrift.com/models/pantheon-benchmark-antigravity-...
- ponyous
Ich habe eine Menge Benchmarks für OpenSCAD für alle möglichen Modelle und Setups durchgeführt, und was ich festgestellt habe, ist:
- Modelle sind sehr gezackt (können bei einer Art von 3D-Modell hervorragend sein, bei einer anderen aber nicht)
- Gemini-Modelle sind in meiner Erfahrung am wenigsten gezackt und haben das beste Bildverständnis
- Gemini-Modelle sind auch die kreativsten (was unerwünscht sein kann, wenn man präzise CAD-Teile möchte)
- Insgesamt beweist dieser Benchmark nicht viel, denn ein einziges 3D-Modell (und ein einziger Versuch) reicht einfach nicht aus. Ich teste normalerweise mindestens ein Dutzend Modelle, die jeweils dreimal generiert werden, aber man sollte eigentlich viel mehr machen – es ist aber für einen Solo-Entwickler zu teuer.
Dennoch danke ich für die Veröffentlichung. Ich werde definitiv bald Flash 3.5 testen, um zu sehen, wie es abschneidet.
- tjoff
Ich hatte selbst so eine schlechte Erfahrung beim Versuch, das zu tun. Man bekommt vielleicht beim ersten Versuch einen halbwegs brauchbaren Entwurf, und dann fängt man an, das zu "debuggen". Nach einer sehr frustrierenden Sitzung stellt man dann fest, dass das Modell die Ergebnisse einfach nicht richtig "sehen" kann. Das heißt, man kann überhaupt nicht darauf iterieren.
Ich vermute, dass die meisten Harnesses/Tools ein Bild vor der Verarbeitung vergrößern oder verkleinern und dabei so viele Details verlieren, dass es viel schwieriger wird, daraus Schlüsse zu ziehen – besonders bei Drahtgitterbildern.
Ich bin mir sicher, dass ich es falsch halte, aber dieser Test hat das nicht wirklich geprüft. Es war nur ein einmaliger Versuch. Das bricht ziemlich schnell zusammen, besonders wenn man keine Referenzbilder von dem hat, was man zu erstellen versucht.
- 1970-01-01
Ein einziges reales Objekt erstellen und es als Benchmark bezeichnen? Nein, so funktioniert das nicht für ein robustes Werkzeug. Man muss etwas wie Iron Chef machen, mit einem Thema griechischer Architektur und einem Panel oder Richter, der den Gewinner verkündet. Das hier ist nur der Versuch herauszufinden, welches Werkzeug subjektiv das bestaussehende Pantheon erstellt.
- ReptileMan
Das Einzige, was sich heutzutage schneller bewegt als KI, sind die Zielstangen. Vor drei Jahren wären wir beeindruckt gewesen, wenn Modelle überhaupt irgendetwas produzieren konnten; jetzt haben wir den Luxus, an Details zu nörgeln. Selbst die schlechtesten Einträge im Benchmark sind ziemlich beeindruckend.
- dhfbshfbu4u3
Noch ein langer Weg, um Autodesk zu shorten.
Als Nebenanmerkung: Autodesk hat bereits im Dezember einen agentenbasierten Assistenten für Fusion veröffentlicht. Sechs Monate später ist er immer noch ziemlich schlecht.