UniEvo-VL: el modelo multimodal que se enseña a sí mismo sin profesor externo

UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement

UniEvo-VL propone un marco de autodestilación en línea donde un único modelo multimodal actúa como profesor y alumno: el alumno solo ve la pregunta original, mientras el profesor se apoya en su propia crítica privilegiada. El entrenamiento minimiza la divergencia entre sus distribuciones de difusión sobre las trayectorias del alumno. Partiendo de Qwen-image-2512, mejora GenEval de 0.747 a 0.808 y GenEval2 Soft-TIFA de 32.97 a 35.53, aunque los avances no son uniformes entre tareas.

En lugar de depender de un profesor separado, a menudo más grande, aprovechamos sus autocríticas como información privilegiada y pedimos a un único modelo multimodal que actúe como profesor y alumno con contextos diferentes.

Más de este día

2026-10-07