2 papers
cs.CV2026
MT-WAM: Reorienting the One-Pass Predictive Representation Toward Action Generation
Yiguang Yang, Jiankun Peng, Xiaoming Wang +2
Fast-WAM shows that video-action co-training improves control without generating future video at inference, making the representation from a single video diffusion Transformer forw…
cs.CV2026
LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
Jiankun Peng, Jianyuan Guo, Yiguang Yang +3
Online topological planning has become an effective paradigm for Vision-Language Navigation in Continuous Environments (VLN-CE), but existing methods still suffer from two limitati…