1 paper · 1 filter
Xiaohuan Pei, Yuxing Chen, Siyu Xu +3
Robotic manipulation with Vision-Language-Action models requires efficient inference over long-horizon multi-modal context, where attention to dense visual tokens dominates computa…