UniEvo-VL, 교사 없이 스스로를 가르쳐 이미지 생성 성능을 끌어올리다
UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement
UniEvo-VL은 별도의 대형 교사 모델 없이 하나의 멀티모달 모델이 교사와 학생 역할을 동시에 맡아 스스로 개선하는 온폴리시 자기증류 기법이다. 학생은 원래 질문만 보고, 교사는 자기 비판을 특권 정보로 조건화한 뒤 두 확산 분포의 발산을 최소화하도록 학습한다. Qwen-image-2512 기반 실험에서 GenEval은 0.747에서 0.808로, GenEval2 Soft-TIFA는 32.97에서 35.53으로 향상됐다. GPT5.6-Luna 같은 외부 비평자를 쓰면 자기진화의 상한이 더 높아질 수 있음을 보였지만, 텍스트 렌더링 혼합 과제에서는 개선이 균일하지 않았다.
더 강력한 외부 비평자(예: GPT5.6-Luna)를 사용한 시도는 강한 판단 능력을 갖춘 멀티모달 모델이 더 높은 자기진화의 상한을 기대할 수 있음을 보여준다.