Paper · Training data
Recursive Self-Improvement in Unified Multimodal Models
A unified multimodal model uses program execution to verify its own generated images, creating a reliable training loop that improves its visual and text capabilities over multiple rounds.

The loop
A unified multimodal model generates images and writes programs to evaluate them, using the verified results to train its own visual understanding and generation.
- UMM generates images and programs
- Execution verifies programs against specifications
- Verified renders and programs form training data
- Data trains UMM visual and text capabilities
- UMM generates images and programs
- Execution verifies programs against specifications
- Verified renders and programs form training data
- Data trains UMM visual and text capabilities
↻ The improved system does the next round, and the loop turns again.
Why it is a road to recursion
Cross-capability self-improvement allows a multimodal model to use one modality to verify and generate training data for another, preventing error accumulation.
Evidence
Four rounds of RSI raise the score on BasicChartBench from 45.7% to 60.2%.
multimodalsynthetic-dataprogram-verification
Related loops
More training data →
Nemotron-4 340B
- Aligned model generates training data
- Reward model judges and filters it
- Data trains next intermediate instruct model
- Next model generates better alignment data
- repeat
Training dataNVIDIA · 2024

Tongyi DeepResearch
- Agent synthesizes agentic pretraining data
- Pipeline adjusts training set in real time
- Data feeds back into model training
- repeat
Training dataTongyi Lab, Alibaba · 2025

SEAL
- Language model generates a self-edit
- Edit is applied as weight update
- RL rewards self-edit by downstream performance
- repeat
Training dataMIT (Zweiger, Pari et al.) · 2025