UniEvo-VL: Multimodale Modelle verbessern sich selbst durch eigene Kritik

UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement

UniEvo-VL ist ein selbst-evolvierender Trainingsansatz für multimodale Modelle, bei dem ein einzelnes Modell sowohl als Lehrer als auch als Schüler fungiert. Der Schüler sieht nur die ursprüngliche Frage, der Lehrer erhält zusätzlich die eigene Kritik als privilegierte Information. Durch Minimierung der Divergenz zwischen ihren Denoising-Diffusionsverteilungen entlang der Sampling-Trajektorien des Schülers verbessert sich die Bildgenerierung deutlich: Aufbauend auf Qwen-image-2512 steigt die GenEval-Leistung von 0,747 auf 0,808 und die GenEval2 Soft-TIFA von 32,97 auf 35,53. Stärkere externe Kritiker wie GPT5.6-Luna deuten auf eine höhere Obergrenze der Selbstverbesserung hin, doch die Verbesserungen fallen nicht über alle Aufgaben hinweg einheitlich aus.

Statt auf einen separaten, oft größeren Lehrer zurückzugreifen, nutzen wir ihre Selbstkritiken als privilegierte Information und lassen ein einzelnes multimodales Modell mit unterschiedlichen Kontexten sowohl als Lehrer als auch als Schüler agieren.

Mehr von diesem Tag

2026-10-07