Magnitude compila y ajusta sus kernels en tu dispositivo para que los modelos abiertos corran hasta 2 veces más rápido que llama.cpp

Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents

Magnitude es un motor de inferencia de código abierto para agentes que se autooptimiza para tu hardware exacto. Compila y ajusta sus kernels en tu dispositivo antes de ejecutar un modelo, logrando hasta 2x más velocidad que llama.cpp: 92% más rápido en decodificación con Metal y 19% con CUDA. Funciona en Apple Silicon, NVIDIA, AMD o solo CPU, y se conecta con un clic a agentes como Pi, OpenCode, Hermes o Codex. Es gratuito, privado y Apache 2.0.

Ellos distribuyen kernels precompilados para grandes clases de hardware. Magnitude compila y ajusta sus kernels en tu dispositivo real antes de que se ejecute un modelo, para que se ajusten a tu chip exacto.
  1. kmike84

    ¿Qué tan precisas son las estimaciones de velocidad en la interfaz? Lo pregunto porque para Qwen 3.8 (Q8) los números de velocidad citados en la interfaz parecen bastante pobres:

    Velocidad estimada en tu máquina

    Tokens de contexto Tokens / seg

    25 000 17

    50 000 16

    75 000 16

    262 144 12

    El número de 262K está bien, pero para tamaños de contexto más bajos (<128K) es aproximadamente 2 veces más lento que los números que obtengo en sesiones reales de mtplx para qwen3.8 q8 (mac m5 max).

    ¿Es falta de optimizaciones, o números incorrectos, o un artefacto del benchmark (por ejemplo, algo que es más difícil para decodificación especulativa que las sesiones agénticas habituales)?

  2. happybox2016

    2x llama.cpp" ¿en qué, una M3 Max? Los kernels metal de llama.cpp ya saturan el ancho de banda de memoria. El verdadero cuello de botella de un agente no es tok/s de un solo flujo, sino la caché KV para 5+ contextos de 128k concurrentes en 24GB de VRAM. ¿Quién ejecuta realmente multiagente en local? A) Solo una sesión B) 2-3 agentes C) 5+ agentes D) Me rendí,

  3. lxe

    En mi máquina de inferencia local tengo un hilo perpetuo de codex abierto en mi checkout de llama.cpp al que periódicamente le pido que eche un vistazo a los PRs pendientes de llama.cpp, que investigue sobre lo último en MTP, Dflash y otras optimizaciones de predicción o atención, que investigue sobre los últimos quants y finetunes de modelos, que mire hilos de localLlama en Reddit y básicamente haga un barrido de la frontera.

    Luego reconstruye lo último de llama.cpp, toma los PRs que encuentra relevantes para probar, y realiza un benchmark y finaliza la actualización y verifica qué modelo, variante o incluso un finetune separado deberíamos estar ejecutando.

    Ocasionalmente, realiza sus propias optimizaciones y commits, que luego son reemplazados por pull requests y código fusionado que esencialmente valida la direccionalidad de optimización del propio modelo.

  4. kmike84

    Esto parece una buena idea. Sin embargo, superar a llama.cpp en velocidad es un listón bajo :)

    Me pareció una buena línea base, pero al menos en Mac siempre había algo mucho más rápido, y/o con mejores requisitos de memoria, como dijiste, ds4, omlx, mtplx, etc. Parece que si usas LLMs locales de verdad, hay muy pocas razones para no usar uno de los motores más optimizados.

    3 modos principales de fallo que observé en los motores:

    * No usar la mejor decodificación especulativa disponible

    * Usar demasiada VRAM para la caché KV (por ejemplo, la caché KV solía ocupar casi nada en ds4, pero una enorme cantidad de VRAM en unsloth/llama.cpp para modelos deepseek)

    * Rendimiento degradado en tamaños de contexto grandes: los benchmarks a 4K o 32K son increíbles, pero a 100-200K realistas es más lento que alguna línea base estúpida

  5. singh_abinashi

    Me da curiosidad cómo funcionan las evaluaciones de esto en cargas de trabajo de agentes reales frente a benchmarks sintéticos. En mi experiencia, los perfiles de coste y latencia de los agentes cambian mucho una vez que hay un bucle de uso de herramientas involucrado, porque la distribución de tokens se vuelve mucho más a ráfagas que con un solo prompt. ¿Evaluaste con trazas de llamadas a herramientas de varios pasos, o mayormente de un solo turno?

Más de este día

2026-09-30