1 paper
Jiahui Fu, Junyu Nan, Lingfeng Sun +5
Solving long-horizon tasks requires robots to integrate high-level semantic reasoning with low-level physical interaction. While vision-language models (VLMs) and video generation…