Tus prompts de 35 KB se desmoronan en Ollama: cómo migrar a modelos autoalojados
Notes on gotchas while migrating 35kb preprompts from Opus to self-hosted Ollama

Patrick McCanna documenta su migración de prompts de 35 KB desde Anthropic y OpenAI hacia Ollama autoalojado en un AMD Ryzen AI MAX+ 395 con 128 GB. El problema no es el tamaño del modelo, sino la ventana de contexto: 65k tokens que un prompt de 35 KB consume al 14%, provocando llamadas repetidas a herramientas y relecturas de archivos. Propone dividir los prompts en unidades de un solo objetivo, definir agentes declarativos en opencode y registrar el estado de sesión en disco para evitar que el contexto se sature.
Con una ventana de contexto limitada, el preprompt básicamente le da instrucciones a un hombre que reencarna cada noventa segundos. Ejecuta tus últimas órdenes sin ninguna conciencia de las 15 demandas anteriores.