Nueve harnesses de código contra tu laptop: la mayoría no está hecha para modelos locales
Nine coding harnesses vs. your laptop

El autor probó nueve harnesses de codificación con Qwen 3.8 27B en una MacBook Pro M4, midiendo tiempos de prefill, reutilización de caché y tokens por segundo. Los resultados muestran que los prompts de sistema grandes y los esquemas de herramientas inflan la espera inicial hasta 226 segundos, mientras que los harnesses ligeros como pi, mini-swe-agent y chad mantienen una experiencia fluida. La conclusión es que la mayoría de las herramientas asumen prefill gratuito en la nube y fallan en localhost.
En tus laptop? Esa es la diferencia entre 22 y 226 segundos, medidos. ¡Insoportable!
- OleksandrC
Si buscas un agente de programación que encaje bien en entornos con recursos limitados (como portátiles, o servidores VPS pequeños, o computadoras de placa única diminutas, etc.) y que además funcione genial con modelos locales, quizá también te guste hax (https://usehax.dev/). Un binario nativo en C con enlace dinámico de 0.7 MB, unos pocos MBs de uso de RAM al ejecutarse, autodescubre la configuración de un llama-server local en ejecución, y usa un prompt de sistema y herramientas minimalistas para un uso de contexto ligero.
- julesrms
En HN parece haber pasado un flujo constante de benchmarks de harnesses de agentes. Y cada vez me pregunto dónde están mirando las personas que crean estas pruebas cuando deciden qué harnesses probar. ¡Porque ahora mismo parece que nadie se molesta en probar el mío! (https://juggler.studio)
Sé que Juggler es muy nuevo, pero hay tanto movimiento en esta área que es difícil saber hacia dónde debería empujarlo. Es difícil adivinar si las fortalezas de juggler encajarían bien con una prueba particular como esta, o si lo harían quedar mal; cualquier comentario sobre el tipo de parámetros que interesan es útil para saber qué optimizar.
- alex_john_m
¿Qué se supone que significa esto?
"se dispersa hasta un 50% entre noches, así que nada entre los brazos magros es un hallazgo".
- toasty228
Un poco fuera de tema porque no uso modelos locales, pero hace poco hice un benchmark de codex vs pi vs omp con mi carga de trabajo y encontré que codex era tanto más rápido como más eficiente en tokens que pi/omp. No hubo ni un solo caso en el que pi fuera más rápido/barato
- larodi
Puedo ver este patrón de mucha gente usando Qwen 3.8 27B para inferencia local tanto en Apple Silicon como en x86. Esto implica que el modelo debe ser muy bueno, dado que la opinión de todas estas personas converge en él.