Warum deine 35-kB-Prompts auf lokalen LLMs verhungern

Notes on gotchas while migrating 35kb preprompts from Opus to self-hosted Ollama

Warum deine 35-kB-Prompts auf lokalen LLMs verhungern

Patrick McCanna dokumentiert den Umstieg von Anthropic und OpenAI auf selbstgehostete Ollama-Modelle. Sein 35-kB-Preprompt frisst sofort 14 % des 65k-Kontextfensters, der Agent wiederholt Tool-Aufrufe, liest Dateien doppelt und schreibt bereits Erledigtes neu. Die eigentliche Ursache ist nicht das kleinere Modell, sondern das begrenzte Kontextfenster. Er empfiehlt Single-Objective-Prompting, deklarative Agenten in opencode, explizites Tuning der Kontextlänge und das Loggen des Session-Status auf die Festplatte.

Mit begrenztem Kontextfenster ist der Pre-Prompt im Grunde ein Briefing für einen Mann, der alle neunzig Sekunden wiedergeboren wird.

Mehr von diesem Tag

2026-09-14