6 papers
OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
Alperen Avan, Jordi Sanchez-Riera
Autonomous indoor navigation requires both semantic understanding and precise geometric control. We propose OptiSight, a hybrid framework that combines Vision-Language Model reason…
Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments
Antoni Valls, Jordi Sanchez-Riera
Accurate visual localization on robotic and wearable platforms remains challenging in dense urban environments. Existing methodologies typically rely on GPS for absolute positionin…
VisionAssist: An Open-Source Smartphone Assistant for AI-Based Visual Accessibility
AyÅe Ãzlem ÃalıÅkan, Jordi Sanchez-Riera
People with low vision often face challenges in performing everyday tasks that require interpreting visual information. We present \textbf{VisionAssist}, an open-source mobile appl…
Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision
Antoni Valls, Jordi Sanchez-Riera
Visual impairment affects hundreds of millions of people worldwide, severely limiting their ability to navigate urban environments safely and independently. While wearable assistiv…
BEA-GS: BEyond RAdiance Supervision in 3DGS for Precise Object Extraction
Alessio Mazzucchelli, Maria Naranjo-Almeida, Jorge Bustos-Sanchez +4
Most Gaussian Splatting techniques that provide a 3D semantic representation of the scene do not optimize the underlying 3D geometry, making object-level editing or asset extractio…
MultiPhys: Multi-Person Physics-aware 3D Motion Estimation
Nicolas Ugrinovic, Boxiao Pan, Georgios Pavlakos +5
We introduce MultiPhys, a method designed for recovering multi-person motion from monocular videos. Our focus lies in capturing coherent spatial placement between pairs of individu…