Antidoom: Wie Liquid AI Doom Loops in Reasoning-Modellen mit Final Token Preference Optimization eliminiert
Reducing Doom Loops with Final Token Preference Optimization

Doom Loops – sich wiederholende Textspannen wie „Wait, let me reconsider…“ – sind ein häufiges Versagensmuster bei Inference, besonders bei kleinen Reasoning-Modellen. Liquid AI stellt mit Antidoom eine gezielte Trainingsmethode vor, die auf Final Token Preference Optimization (FTPO) basiert. Statt eines pauschalen repetition_penalty wird das erste Token einer Schleife identifiziert und das Modell trainiert, an dieser Position kohärente Alternativen zu bevorzugen. Bei einem frühen Checkpoint von LFM2.5-2.6B sank die Doom-Loop-Rate von 10,2 % auf 1,4 %, bei Qwen3.5-4B von 22,9 % auf 1 %, während die Eval-Scores stiegen. Der Beitrag analysiert die Mechanismen hinter Loops und zeigt, dass höhere Temperaturen nach der Eliminierung von Loops nicht mehr vorteilhaft sind.
Once doom loops are eliminated, stronger eval performance is seen with near-greedy sampling, at least in the models tested here.