MiMo-V2.5: la eficiencia de SWA híbrida llevada al límite en producción
Inference Optimization for MiMo v2.5: Pushing Hybrid SWA Efficiency to the Limit

Xiaomi detalla la optimización integral del sistema de inferencia para su familia de modelos MiMo-V2.5, que combina atención de ventana deslizante híbrida (SWA), activación dispersa de MoE y codificadores multimodales. El artículo explica cómo refactorizaron la gestión de KVCache con un diseño de doble pool, árboles de caché de prefijos conscientes de SWA y un sistema de caché distribuida llamado GCache. Estas técnicas reducen el almacenamiento de KVCache a aproximadamente 1/7, mejoran la tasa de aciertos y optimizan los pipelines de prefill y decode, logrando así una eficiencia teórica en escenarios de contexto largo y multimodal.
La compresión del volumen de KV a 1/7 es un beneficio a nivel de capacidad, mientras que la tasa de aciertos es un beneficio a nivel de reutilización; juntos determinan la curva real de costo de cómputo del prefill.