Ejecutando el modelo Kimi K3 de 2.78 billones de parámetros con solo 29 GB de RAM

Run Kimi K3 using 29 GB of RAM at 0.50 tok/s

Presento WASTE, un motor de inferencia en C que ejecuta el modelo completo Kimi K3 en portátiles de consumo. Al transmitir pesos desde NVMe y mantener solo el tronco en memoria, logro ejecutar 2.78 billones de parámetros sin depender de servidores o APIs, demostrando que la ingeniería puede superar las limitaciones de hardware actuales.

Cada token respondido por un servicio en la nube se paga dos veces: una en la factura y otra en la electricidad de un centro de datos ejecutando un modelo que cabría, apenas y torpemente, en el hardware que ya tienes sobre tu escritorio.

Más de este día

2026-07-31