Liquid AI、推論モデルの「Doom Loop」を1.4%まで低減する新手法「Antidoom」を公開
Reducing Doom Loops with Final Token Preference Optimization

推論モデルが同じフレーズを繰り返し、コンテキストウィンドウを消費する「Doom Loop」は、特に小型の推論モデルで発生しやすい問題です。従来のrepetition_penaltyは対症療法に過ぎず、性能を劣化させる可能性があります。Liquid AIの新手法「Antidoom」は、ループの起点となるトークンを特定し、その位置でのみ好ましい代替トークンを学習するFTPO(Final Token Preference Optimization)を用います。LFM2.5-2.6Bの初期チェックポイントでは、Doom Loop発生率が10.2%から1.4%に低下し、評価スコアも向上しました。Qwen3.5-4Bでも22.9%から1%に低減しています。コードとデータセットは公開されています。
Antidoomは、ループを開始する問題のあるトークンを選択的にターゲットにし、残りの分布への巻き添えを最小限に抑えます。