Showing cs.ROShow all
2 papers · 1 filter
cs.RO2026
Retrieve in Time, Correct in Frequency
Yuze Fan, Yue Cao, Pengjie Gao +7
Frozen vision-language-action (VLA) policies generate temporally extended action chunks, but long-horizon manipulation remains vulnerable to accumulated execution error and visual…
cs.RO2025
PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
Liang Ma, Jiajun Wen, Min Lin +12
While vision-language models (VLMs) have demonstrated promising capabilities in reasoning and planning for embodied agents, their ability to comprehend physical phenomena, particul…