GLM construyó su propia infraestructura de inferencia

GLM Built Its Own Inference Infrastructure

GLM construyó su propia infraestructura de inferencia

GLM-5.3-Flash se desplegó en un clúster de más de 100.000 aceleradores chinos y, en seis días, procesó 62 billones de tokens en OpenCode y OpenRouter bajo el nombre Ox-Alpha. Un Infra Agent basado en GLM-5.3 realizó gran parte del trabajo de optimización, logrando un rendimiento 3× superior y costos por token comparables a los de NVIDIA. El artículo detalla cómo un feedback denso y atribuible permitió al agente detectar y corregir errores numéricos y de rendimiento en tiempo real.

Si esta tendencia continúa, con suficiente cómputo y suficiente tiempo, su punto final es un sistema que puede diseñar y entrenar a su propio sucesor de forma totalmente autónoma.

Más de este día

2026-09-17