GLM 5.3 Flash Max con OpenCode logra un 96.89% de precisión en una tarea de Three.js
I tested 10 model/harness combinations on the same Three.js task
El autor probó diez combinaciones de modelos y herramientas (Codex, OMP, OpenCode, DSH/PTC y DSH) con el mismo prompt para construir un hangar sci-fi en Three.js. Midió tiempo, tokens, precisión y errores. El resultado más destacado: GLM 5.3 Flash Max con OpenCode alcanzó un 96.89% de precisión, superando a otras configuraciones. En contraste, Astra 6.0 Max con Codex tardó 37 minutos, y Qwen 3.8 27B con DSH/PTC mostró la mayor cantidad de errores de herramienta. El autor detalla la metodología y las métricas para que otros puedan replicar la evaluación.
- onion2k
La versión Astra parece haber usado three.js r170, que es de octubre de 2024. Sol usó una versión incluso anterior. El código de GLM usó la última versión, pero creo que solo está obteniendo three.js@latest de jsdelivr, así que es poco probable que esté escribiendo código contra esa versión. Qwen en OpenCode también obtiene de jsdelivr, pero usando una versión fijada en r160.
No creo que ninguno de estos ejemplos esté usando cosas como tone mapping, así que están atascados en sRGB (AgX o ACES se ven mucho mejor), no están usando los materiales de nodos (buenos para la implementación programática de texturas), y no están haciendo nada genial como hornear entornos de sombras o usar efectos de post-procesamiento.
Son bonitos, pero creo que muestran lo lejos que están los modelos de IA en este tipo de proyecto más que lo buenos que son.
- utopiah
Desearía que hubiera otra columna con el costo estimado para cada uno, con una fecha específica.
Idealmente también encontrar de alguna manera (no estoy seguro de cuál sería la forma correcta) qué está disponible públicamente antes de ejecutar la prueba. Es un resultado bastante diferente si hay competiciones, por ejemplo js13k, ejemplos de código en vivo de libros, incluso plantillas, sobre ese tema específico. Visualmente aquí los resultados se ven muy muy similares hasta el punto de que no puedo evitar preguntarme si es el resultado del prompt corto pero relativamente descriptivo o porque siempre se encontró y utilizó alguna plantilla.
- alvins82
Por cierto, en mi búsqueda de una buena aplicación de escritorio tipo codex/claude - https://github.com/openchamber/openchamber - este parece ser el líder. Lo combino con OMP a través de https://github.com/alvins82/omp-openchamber-server/.
Quería una GUI+harness potente para modelos abiertos para poder usarlos/probarlos a medida que salieran.
- poilcn
Bien. Pero estas pruebas plantean una pregunta: qué resultados son reproducibles, el visual final, el tiempo, la llamada a herramientas o si es mayormente ruido. Por ejemplo, ¿han probado la misma combinación de modelo y harness varias veces?
- rao-v
Es realmente interesante cómo pequeñas elecciones hacen que el resultado sea mejor o peor. Astra y uno de los GLMs añadieron luces brillantes, y por eso se veían mucho mejor a mi ojo.
Genuinamente contento con algunos de los resultados de Qwen 3.8 (especialmente ya que puedo ejecutar ese modelo en Q8).
Interesante ver cuánto mejor (en esta tarea) es Pi (OMP) sobre Opencode como harness.
Me encantaría ver algunos más con resultados que sean fáciles de juzgar pero menos subjetivos.
Tengo un proyecto de juguete en marcha para hacer un simulador de batalla divertido de ver donde un LLM (o dos si se juega contra) tiene que escribir programas que controlen múltiples bots (cada uno con su propia línea de visión y contexto de batalla limitado) que tengan que coordinarse y luchar entre sí. El objetivo es que el LLM actualice el código basado en situaciones actuales quizás 5-10 veces en una batalla simulada de 5 minutos. Explorando incluso permitir que los bots soliciten nueva programación y puntuar basado en el número de pasos de reprogramación.