9 papers
MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation
Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5
In camera-controlled video generation, geometry-aware positional encodings condition tokens on camera extrinsics and per-token viewing rays. Existing schemes, however, have a scale…
MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations
Kangxu Wang, Siang Chen, Chenxing Jiang +3
Single-view RGB-D grasp detection remains a common choice in 6-DoF robotic grasping systems, which typically requires a depth sensor. While RGB-only 6-DoF grasp methods has been st…
Geometry-Grounded Gaussian Splatting
Baowen Zhang, Chenxing Jiang, Heng Li +2
Gaussian Splatting (GS) has demonstrated impressive quality and efficiency in novel view synthesis. However, shape extraction from Gaussian primitives remains an open problem. Due…
CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
Zhijian Qiao, Zehuan Yu, Tong Li +3
Crowdsourcing enables scalable autonomous driving map construction, but low-cost sensor noise hinders quality from improving with data volume. We propose CSMapping, a system that p…
ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories
Yaokun Li, Shuaixian Wang, Mantang Guo +6
Synthesizing multi-pass videos is important for autonomous driving. While current repair-based methods often struggle with out-of-distribution artifacts, camera-controlled methods…
MultiPark: Multimodal Parking Transformer with Next-Segment Prediction
Han Zheng, Zikang Zhou, Guli Zhang +6
Parking accurately and safely in highly constrained spaces remains a critical challenge. Unlike structured driving environments, parking requires executing complex maneuvers such a…