3 papers
cs.CV2026
HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion
Xuzhe Zheng, Yuexiao Ma, Jing Xu +3
Sparse attention accelerates video diffusion by allowing each attention head to focus on only a small subset of interactions. Existing methods already construct head-specific spars…
cs.RO2026
CUBic: Coordinated Unified Bimanual Perception and Control Framework
Xingyu Wang, Pengxiang Ding, Jingkai Xu +2
Recent advances in visuomotor policy learning have enabled robots to perform control directly from visual inputs. Yet, extending such end-to-end learning from single-arm to bimanua…
cs.CV2026
TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection
Yifeng Yang, Jubo Feng, Jing Xu +3
Vision-language models enable OOD detection by comparing image alignment with ID labels and negative semantics. Existing negative-label-based methods mainly rely on static negative…