10 papers · 1 filter
QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment
Arian Kheirandish, Fardin Ayar, Ehsan Javanmardi +2
Video instance segmentation (VIS) requires models to detect, segment, and track object identities across frames, and most methods enforce temporal consistency through video-level s…
DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video
Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao +1
Assessing the severity of a traffic accident scenario is important to decide which emergency service to dispatch. Missing an ambulance dispatch on a pedestrian accident is a fatal…
How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation
Saba Fathi, Fardin Ayar, Maryam Abdolali +3
Diffusion models have recently been repurposed for zero-shot classification, giving rise to diffusion classifiers that identify the best-matching text prompt by minimizing the nois…
SUG-Occ: Explicit Semantics and Uncertainty Guided Sparse Learning for Efficient 3D Occupancy Prediction
Hanlin Wu, Pengfei Lin, Ehsan Javanmardi +4
3D semantic occupancy prediction has emerged as a critical perception task for autonomous driving due to its ability to offer voxel-level semantic and geometric understanding of th…
A Synthetic Benchmark for Collaborative 3D Semantic Occupancy Prediction in V2X-Enabled Autonomous Driving
Hanlin Wu, Pengfei Lin, Ehsan Javanmardi +4
3D semantic occupancy prediction is an emerging perception paradigm in autonomous driving, providing a voxel-level representation of both geometric details and semantic categories.…
UTrice: Unifying Primitives in Differentiable Ray Tracing and Rasterization via Triangles for Particle-Based 3D Scenes
Changhe Liu, Ehsan Javanmardi, Naren Bao +2
Ray tracing 3D Gaussian particles enables realistic effects such as depth of field, refractions, and flexible camera modeling for novel-view synthesis. However, existing methods tr…