Un mes programando con GLM 5.3 Flash: solo la mitad del presupuesto se usó en el modelo objetivo
One month coding with GLM 5.3 Flash

El equipo de Wagtail intentó usar exclusivamente GLM 5.3 Flash durante un mes para programar, pero solo la mitad de los 2 mil millones de tokens se destinaron a ese modelo. Los obstáculos incluyeron un prototipo de servidor MCP que consumió 450 millones de tokens en una noche, problemas de capacidad del proveedor y la necesidad de experimentar con otros modelos. Aprendieron a medir el uso localmente y a presupuestar la experimentación.
Para el trabajo diario de desarrollo, es totalmente viable centrarse en uno o dos modelos baratos de la gama flash. Un objetivo viable es probablemente que la mayoría del trabajo de inferencia de IA se realice con modelos eficientes, medido en coste o energía en lugar de tokens sin sentido.