UniEvo-VL: мультимодальная модель учит себя сама, без внешнего учителя

UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement

UniEvo-VL — это self-evolving фреймворк, в котором одна мультимодальная модель выступает и учителем, и учеником: ученик видит только исходный вопрос, а учитель — ещё и собственную критику. Обучение минимизирует расхождение между их диффузионными распределениями на траекториях сэмплирования ученика. На базе Qwen-image-2512 результат GenEval вырос с 0.747 до 0.808, а GenEval2 Soft-TIFA — с 32.97 до 35.53.

Вместо того чтобы полагаться на отдельного, зачастую более крупного учителя, мы используем их самокритику как привилегированную информацию и просим одну мультимодальную модель выступать одновременно и учителем, и учеником с разными контекстами.

Ещё за этот день

2026-10-07