interactive text-to-video 1long-form video continuation 1multilingual prompts 1real-time video generation 1streaming generation memory 1
From the 1 of 14 linked papers with an AI index.
Showing cs.ROShow all
3 papers · 1 filter
cs.RO2025
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
Yanjia Huang, Xianshun Jiang, Xiangbo Gao +2
Vision-and-Language Navigation (VLN) requires agents to follow language instructions while acting in continuous real-world spaces. Prior image imagination based VLN work shows bene…
cs.RO2025
FORGE-Tree: Diffusion-Forcing Tree Search for Long-Horizon Robot Manipulation
Yanjia Huang, Shuo Liu, Sheng Liu +4
Long-horizon robot manipulation tasks remain challenging for Vision-Language-Action (VLA) policies due to drift and exposure bias, often denoise the entire trajectory with fixed hy…
cs.RO2025
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
Yanjia Huang, Mingyang Wu, Renjie Li +1
Vision-and-Language Navigation (VLN) tasks agents with locating specific objects in unseen environments using natural language instructions and visual cues. Many existing VLN appro…