12 KI-Modelle bauen dieselben 4 Apps – GPT-5.6, Grok 4.5, Claude und Muse Spark im Vergleich
GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps
Nach dem Feedback zur letzten Ausgabe hat tryai.dev den Vergleich erweitert: Zwölf Modelle – darunter GPT-5.6 in drei Stufen, Grok 4.5, Claude Opus 4.8 und Fable 5, sowie Open-Weight-Modelle wie GLM-5.2 und DeepSeek V4 Pro – mussten vier Web-Apps bauen: einen Raycaster, einen Zauberwürfel, einen Taschenrechner und Conway's Game of Life. Jedes Modell hatte fünf Versuche pro Aufgabe, alle Ergebnisse sind offen einsehbar. Die Beobachtungen zeigen: GPT-5.6 Sol glänzt beim Raycaster, Claude Fable 5 überzeugt beim Zauberwürfel, und Muse Spark 1.1 überrascht positiv, wenn es funktioniert.
Muse Spark war eine echte Überraschung bei den Läufen, die tatsächlich funktionierten.