UniEvo-VL: Self-Distillation Training for Multimodal Model Self-Improvement
Les auteurs proposent UniEvo-VL, un cadre d'auto-évolution pour modèles multimodaux qui apprend en utilisant l'auto-correction constructive générée pendant le calcul au moment des tests. Plutôt que d'utiliser un enseignant externe plus large, le même modèle multimodal joue simultanément le rôle d'enseignant et d'étudiant avec des contextes différents, l'étudiant ne voyant que la question brute tandis que l'enseignant se conditionne sur une auto-critique privilégiée. L'entraînement minimise la divergence par état entre leurs distributions de diffusion de débruitage le long des trajectoires d'échantillonnage de l'étudiant. Sur la base de Qwen-image-2512, UniEvo-VL améliore les performances de génération d'images (GenEval de 0,747 à 0,808 et GenEval2 Soft-TIFA de 32,97 à 35,53) et conserve la sensibilité aux informations de réflexion supplémentaires. Les essais avec des critiques externes plus puissantes indiquent un plafond d'auto-amélioration plus élevé tandis que des résultats mixtes en rendu de texte montrent que les gains ne sont pas uniformes selon les tâches, et les auteurs discutent des implications pour l'amélioration récursive sans supervision externe.