activity
20242026
collaborators

9 papers

cs.CV2026

MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation

Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5

In camera-controlled video generation, geometry-aware positional encodings condition tokens on camera extrinsics and per-token viewing rays. Existing schemes, however, have a scale…

cs.RO2026

MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations

Kangxu Wang, Siang Chen, Chenxing Jiang +3

Single-view RGB-D grasp detection remains a common choice in 6-DoF robotic grasping systems, which typically requires a depth sensor. While RGB-only 6-DoF grasp methods has been st…

cs.CV2026

Geometry-Grounded Gaussian Splatting

Baowen Zhang, Chenxing Jiang, Heng Li +2

Gaussian Splatting (GS) has demonstrated impressive quality and efficiency in novel view synthesis. However, shape extraction from Gaussian primitives remains an open problem. Due…

cs.CV2025

CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving

Zhijian Qiao, Zehuan Yu, Tong Li +3

Crowdsourcing enables scalable autonomous driving map construction, but low-cost sensor noise hinders quality from improving with data volume. We propose CSMapping, a system that p…

cs.CV2025

ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories

Yaokun Li, Shuaixian Wang, Mantang Guo +6

Synthesizing multi-pass videos is important for autonomous driving. While current repair-based methods often struggle with out-of-distribution artifacts, camera-controlled methods…

cs.RO2025

MultiPark: Multimodal Parking Transformer with Next-Segment Prediction

Han Zheng, Zikang Zhou, Guli Zhang +6

Parking accurately and safely in highly constrained spaces remains a critical challenge. Unlike structured driving environments, parking requires executing complex maneuvers such a…