OPD-V: Visual On-Policy Self-Distillation with Modality Balance
Aniri, Jinhe Bi, Peng Liao, et al.
OPD-V introduces a visual on-policy self-distillation paradigm that uses modality-balance trust regions to improve MLLM reasoning while reducing training cost.