1 paper
Meghana Sunil, Manikandarajan Venmathimaran, Muthu Subash Kavitha
Recent work shows that large multimodal models (LMMs) can self-improve from unlabeled data via self-play and intrinsic feedback. Yet existing self-evolving frameworks mainly reward…