Liquid AI, '둠 루프' 반복 오류를 10.2%에서 1.4%로 줄인 Antidoom 공개

Reducing Doom Loops with Final Token Preference Optimization

Liquid AI, '둠 루프' 반복 오류를 10.2%에서 1.4%로 줄인 Antidoom 공개

Liquid AI가 추론 중 모델이 같은 문장을 반복하는 '둠 루프(doom loop)' 현상을 해결하기 위해 개발한 Antidoom 기법을 소개한다. 반복의 시작점이 되는 첫 토큰을 정확히 찾아내어, 그 위치에서만 선택지(preference)를 학습시키는 Final Token Preference Optimization(FTPO)을 적용한다. LFM2.5-2.6B 초기 체크포인트에서 둠 루프 발생률을 10.2%에서 1.4%로 낮췄으며, 벤치마크 점수도 함께 향상되었다. Qwen3.5-4B에서도 유사한 효과를 확인했다. 코드와 데이터셋은 공개되어 있다.

둠 루프가 제거되면, 적어도 테스트한 모델에서는 거의 탐욕적 샘플링에 가까운 낮은 온도에서 더 강력한 평가 성능이 나타난다.

이 날의 다른 글

2026-07-07