1 paper
Jizhizi Li, Jiayang Ao, Danny Wicks +1
Many multimodal learning tasks require supervision that remains consistent across edits, viewpoints, and scene-level interventions. However, such supervision is difficult to obtain…