1 paper
Yang Xu, Gurpreet Singh Mukker, Raymond Wang +3
Practical robotic grasping in complex scenes requires both 3D spatial reasoning and alignment with task-specific requirements. Vision-language models (VLMs) offer a natural way to…