Cerebras CS-4 promete inferencia hasta 30 veces más rápida que las GPUs

Cerebras presenta el CS-4, un sistema a escala de rack que integra tres WSE-3 Turbo y ofrece hasta 30 veces más velocidad de inferencia que los sistemas con GPUs. Gracias a una nueva arquitectura modular, entrega más de 1.000 tokens por segundo en modelos de más de 10 billones de parámetros, con una latencia entre wafers de solo 2 microsegundos. El diseño reduce los componentes en un 50% y acelera el despliegue de días a horas, optimizando el rendimiento por vatio y simplificando el mantenimiento en centros de datos a hiperescala.
Al reducir la latencia de interconexión entre wafers a 2 microsegundos, CS-4 ofrece más de 1.000 tokens por segundo en modelos que superan los 10 billones de parámetros, preservando el rendimiento de decodificación interactiva a una escala sin precedentes.