Publications (430)
SPA: Verbal Interactions between Agents and Avatars in Shared Virtual Environments using Propositional Planning
Andrew Best, Sahil Narang, Dinesh Manocha
RLFC: Random Access Light Field Compression using Key Views and Bounded Integer Encoding
Srihari Pratapa, Dinesh Manocha
TS-RIR: Translated synthetic room impulse responses for speech augmentation
Anton Ratnarajah, Zhenyu Tang, Dinesh Manocha
Fine-Grained Vehicle Perception via 3D Part-Guided Visual Data Augmentation
Feixiang Lu, Zongdai Liu, Hui Miao +5
Speech2UnifiedExpressions: Synchronous Synthesis of Co-Speech Affective Face and Body Expressions from Affordable Inputs
Uttaran Bhattacharya, Aniket Bera, Dinesh Manocha
Redirected Walking in Static and Dynamic Scenes Using Visibility Polygons
Niall L. Williams, Aniket Bera, Dinesh Manocha
Collision-Free Kinematics for Redundant Manipulators in Dynamic Scenes using Optimal Reciprocal Velocity Obstacles
Liangliang Zhao, Jingdong Zhao, Hong Liu +1
Relic: Enhancing Reward Model Generalization for Low-Resource Indic Languages with Few-Shot Examples
Soumya Suvra Ghosal, Vaibhav Singh, Akash Ghosh +4
Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation
Samarth Chopra, Jing Liang, Gershom Seneviratne +5
VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
Zongxia Li, Xiyang Wu, Guangyao Shi +6
VRDoc: Gaze-based Interactions for VR Reading Experience
Geonsun Lee, Jennifer Healey, Dinesh Manocha
Diffraction-Aware Sound Localization for a Non-Line-of-Sight Source
Inkyu An, Doheon Lee, Jung-woo Choi +2
GAMEOPT+: Improving Fuel Efficiency in Unregulated Heterogeneous Traffic Intersections via Optimal Multi-agent Cooperative Control
Nilesh Suriyarachchi, Rohan Chandra, Arya Anantula +2
P-Cloth: Interactive Complex Cloth Simulation on Multi-GPU Systems using Dynamic Matrix Assembly and Pipelined Implicit Integrators
Cheng Li, Min Tang, Ruofeng Tong +3
Placing Human Animations into 3D Scenes by Learning Interaction- and Geometry-Driven Keyframes
James F. Mullen, Divya Kothandaraman, Aniket Bera +1
Dense Multi-Agent Navigation Using Voronoi Cells and Congestion Metric-based Replanning
Senthil Hariharan Arul, Dinesh Manocha
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
Soumya Suvra Ghosal, Samyadeep Basu, Soheil Feizi +1
BEDRF: Bidirectional Edge Diffraction Response Function for Interactive Sound Propagation
Chunxiao Cao, Zili An, Zhong Ren +2
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar +15
Learning Acoustic Scattering Fields for Dynamic Interactive Sound Propagation
Zhenyu Tang, Hsien-Yu Meng, Dinesh Manocha
AFR: An Efficient Buffering Algorithm for Cloud Robotic Systems
Yu-Ping Wang, Hao-Ning Wang, Zi-Xin Zou +1
UAVTwin: Neural Digital Twins for UAVs using Gaussian Splatting
Jaehoon Choi, Dongki Jung, Yonghan Lee +3
Regression and Classification for Direction-of-Arrival Estimation with Convolutional Recurrent Neural Networks
Zhenyu Tang, John D. Kanu, Kevin Hogan +1
AGL-NET: Aerial-Ground Cross-Modal Global Localization with Varying Scales
Tianrui Guan, Ruiqi Xian, Xijun Wang +4
A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models
Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh +3
BioAug: Conditional Generation based Data Augmentation for Low-Resource Biomedical NER
Sreyan Ghosh, Utkarsh Tyagi, Sonal Kumar +1
Realtime Multilevel Crowd Tracking using Reciprocal Velocity Obstacles
Aniket Bera, Dinesh Manocha
CoMet: Modeling Group Cohesion for Socially Compliant Robot Navigation in Crowded Scenes
Adarsh Jagan Sathyamoorthy, Utsav Patel, Moumita Paul +3
GrASPE: Graph based Multimodal Fusion for Robot Navigation in Unstructured Outdoor Environments
Kasun Weerakoon, Adarsh Jagan Sathyamoorthy, Jing Liang +3
An Intelligent Self-driving Truck System For Highway Transportation
Dawei Wang, Lingping Gao, Ziquan Lan +9
Forecasting Trajectory and Behavior of Road-Agents Using Spectral Clustering in Graph-LSTMs
Rohan Chandra, Tianrui Guan, Srujan Panuganti +4
Joint Search of Optimal Topology and Trajectory for Planar Linkages
Zherong Pan, Min Liu, Xifeng Gao +1
Robust 2D/3D Vehicle Parsing in CVIS
Hui Miao, Feixiang Lu, Zongdai Liu +3
LPaintB: Learning to Paint from Self-Supervision
Biao Jia, Jonathan Brandt, Radomir Mech +2
Paired-CSLiDAR: Height-Stratified Registration for Cross-Source Aerial-Ground LiDAR Pose Refinement
Montana Hoover, Jing Liang, Tianrui Guan +1
MESH2IR: Neural Acoustic Impulse Response Generator for Complex 3D Scenes
Anton Ratnarajah, Zhenyu Tang, Rohith Chandrashekar Aralikatti +1
TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models
Aryan Vijay Bhosale, Harshit Rajgarhia, Abhishek Mukherji +1
Scene-Aware Audio Rendering via Deep Acoustic Analysis
Zhenyu Tang, Nicholas J. Bryan, Dingzeyu Li +2
Learning Resilient Behaviors for Navigation Under Uncertainty
Tingxiang Fan, Pinxin Long, Wenxi Liu +3
ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions
Sreyan Ghosh, Utkarsh Tyagi, Sonal Kumar +4
UAV4D: Dynamic Neural Rendering of Human-Centric UAV Imagery using Gaussian Splatting
Jaehoon Choi, Dongki Jung, Christopher Maxey +4
TK-Planes: Tiered K-Planes with High Dimensional Feature Vectors for Dynamic UAV-based Scenes
Christopher Maxey, Jaehoon Choi, Yonghan Lee +3
ChartLens: Fine-grained Visual Attribution in Charts
Manan Suri, Puneet Mathur, Nedim Lipka +3
GAMEOPT: Optimal Real-time Multi-Agent Planning and Control for Dynamic Intersections
Nilesh Suriyarachchi, Rohan Chandra, John S. Baras +1
Do Audio-Visual Large Language Models Really See and Hear?
Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi +3
VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation
Manan Suri, Puneet Mathur, Franck Dernoncourt +3
SLICER: Learning universal audio representations using low-resource self-supervised pre-training
Ashish Seth, Sreyan Ghosh, S. Umesh +1
Towards Optimal Multi-draft Speculative Decoding
Zhengmian Hu, Tong Zheng, Vignesh Viswanathan +5
DALE: Generative Data Augmentation for Low-Resource Legal NLP
Sreyan Ghosh, Chandra Kiran Evuru, Sonal Kumar +4
MaxMin-RLHF: Alignment with Diverse Human Preferences
Souradip Chakraborty, Jiahao Qiu, Hui Yuan +5
Towards Possibilities & Impossibilities of AI-generated Text Detection: A Survey
Soumya Suvra Ghosal, Souradip Chakraborty, Jonas Geiping +3
HMLFC: Hierarchical Motion-Compensated Light Field Compression for Interactive Rendering
Srihar Pratapa, Dinesh Manocha
RPG360: Robust 360 Depth Estimation with Perspective Foundation Models and Graph Optimization
Dongki Jung, Jaehoon Choi, Yonghan Lee +1
NavMoE: Hybrid Model- and Learning-based Traversability Estimation for Local Navigation via Mixture of Experts
Botao He, Amir Hossein Shahidzadeh, Yu Chen +8
TNS: Terrain Traversability Mapping and Navigation System for Autonomous Excavators
Tianrui Guan, Zhenpeng He, Ruitao Song +2
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
Ashish Seth, Sonal Kumar, Ramaneswaran Selvakumar +5
Identifying Driver Behaviors using Trajectory Features for Vehicle Navigation
Ernest Cheung, Aniket Bera, Emily Kubin +2
Improving Reverberant Speech Training Using Diffuse Acoustic Simulation
Zhenyu Tang, Lianwu Chen, Bo Wu +2
3D-OGSE: Online Safe and Smooth Trajectory Generation using Generalized Shape Expansion in Unknown 3-D Environments
Vrushabh Zinage, Senthil Hariharan Arul, Dinesh Manocha +1
COVID-Robot: Monitoring Social Distancing Constraints in Crowded Scenarios
Adarsh Jagan Sathyamoorthy, Utsav Patel, Yash Ajay Savle +2
Data-Driven Modeling of Group Entitativity in Virtual Environments
Aniket Bera, Tanmay Randhavane, Emily Kubin +3
CHOP: Counterfactual Human Preference Labels Improve Obstacle Avoidance in Visuomotor Navigation Policies
Gershom Seneviratne, Jianyu An, Vaibhav Shende +6
TAC: Timestamped Audio Captioning
Sonal Kumar, Prem Seetharaman, Ke Chen +8
NeoNav: Improving the Generalization of Visual Navigation via Generating Next Expected Observations
Qiaoyun Wu, Dinesh Manocha, Jun Wang +1
LCrowdV: Generating Labeled Videos for Simulation-based Crowd Behavior Learning
Ernest Cheung, Tsan Kwong Wong, Aniket Bera +2
EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception
Sanjoy Chowdhury, Subrata Biswas, Sayan Nag +7
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
Sreyan Ghosh, Ashish Seth, Sonal Kumar +7
IM360: Large-scale Indoor Mapping with 360 Cameras
Dongki Jung, Jaehoon Choi, Yonghan Lee +1
On the Vulnerability of LLM/VLM-Controlled Robotics
Xiyang Wu, Souradip Chakraborty, Ruiqi Xian +6
LSwarm: Efficient Collision Avoidance for Large Swarms with Coverage Constraints in Complex Urban Scenes
Senthil Hariharan Arul, Adarsh Jagan Sathyamoorthy, Shivang Patel +4
PanoPlane: Plane-Aware Panoramic Completion for Sparse-View Indoor 3D Gaussian Splatting
Adil Qureshi, Dongki Jung, Jaehoon Choi +1
APoLLo: Unified Adapter and Prompt Learning for Vision Language Models
Sanjoy Chowdhury, Sayan Nag, Dinesh Manocha
V-Trans4Style: Visual Transition Recommendation for Video Production Style Adaptation
Pooja Guhan, Tsung-Wei Huang, Guan-Ming Su +2
Efficient Multi-Agent Global Navigation Using Interpolating Bridges
Liang He, Jia Pan, Dinesh Manocha
Indoor Wireless Signal Modeling with Smooth Surface Diffraction Effects
Ruichen Wang, Samuel Audia, Dinesh Manocha
M-MELD: A Multilingual Multi-Party Dataset for Emotion Recognition in Conversations
Sreyan Ghosh, S Ramaneswaran, Utkarsh Tyagi +4
Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces
Sanjoy Chowdhury, Dinesh Manocha
VV-Net: Voxel VAE Net with Group Convolutions for Point Cloud Segmentation
Hsien-Yu Meng, Lin Gao, YuKun Lai +1
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
Nishit Anand, Ashish Seth, Ramani Duraiswami +1
AdVENTR: Autonomous Robot Navigation in Complex Outdoor Environments
Kasun Weerakoon, Adarsh Jagan Sathyamoorthy, Mohamed Elnoor +1
Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
Xiyang Wu, Zongxia Li, Guangyao Shi +5
StylePredict: Machine Theory of Mind for Human Driver Behavior From Trajectories
Rohan Chandra, Aniket Bera, Dinesh Manocha
ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations
Sreyan Ghosh, Chandra Kiran Reddy Evuru, Sonal Kumar +4
Interactive Sound Rendering on Mobile Devices using Ray-Parameterized Reverberation Filters
Carl Schissler, Dinesh Manocha
MTG: Mapless Trajectory Generator with Traversability Coverage for Outdoor Navigation
Jing Liang, Peng Gao, Xuesu Xiao +4
AMCO: Adaptive Multimodal Coupling of Vision and Proprioception for Quadruped Robot Navigation in Outdoor Environments
Mohamed Elnoor, Kasun Weerakoon, Adarsh Jagan Sathyamoorthy +3
M3DeTR: Multi-representation, Multi-scale, Mutual-relation 3D Object Detection with Transformers
Tianrui Guan, Jun Wang, Shiyi Lan +4
Multi-Agent Coverage in Urban Environments
Shivang Patel, Senthil Hariharan, Pranav Dhulipala +4
Personality-Aware Probabilistic Map for Trajectory Prediction of Pedestrians
Chaochao Li, Pei Lv, Mingliang Xu +4
Heter-Sim: Heterogeneous multi-agent systems simulation by interactive data-driven optimization
Jiaping Ren, Wei Xiang, Yangxi Xiao +3
ProNav: Proprioceptive Traversability Estimation for Legged Robot Navigation in Outdoor Environments
Mohamed Elnoor, Adarsh Jagan Sathyamoorthy, Kasun Weerakoon +1
D2-TPred: Discontinuous Dependency for Trajectory Prediction under Traffic Lights
Yuzhen Zhang, Wentong Wang, Weizhi Guo +4
VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models
Ruiqi Xian, Yuehan Xian, Jing Liang +2
The paper introduces VISA, a training-time method that uses a visual‑language model to audit and correct semantic labels of 3D voxel occupancy maps, improving object and rare‑class…
P-Reverb: Perceptual Characterization of Early and Late Reflections for Auditory Displays
Atul Rungta, Nicholas Rewkowski, Roberta Klatzky +1
Leveraging Long-Term Predictions and Online-Learning in Agent-based Multiple Person Tracking
Wenxi Liu, Antoni B. Chan, Rynson W. H. Lau +1
A Psychoacoustic Quality Criterion for Path-Traced Sound Propagation
Chunxiao Cao, Zili An, Zhong Ren +2
A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality
Mohamed Elmoghany, Ryan Rossi, Seunghyun Yoon +26
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
Mohamad Chehade, Soumya Suvra Ghosal, Souradip Chakraborty +4
DS-MPEPC: Safe and Deadlock-Avoiding Robot Navigation in Cluttered Dynamic Scenes
Senthil Hariharan Arul, Jong Jin Park, Dinesh Manocha
EmotiCon: Context-Aware Multimodal Emotion Recognition using Frege's Principle
Trisha Mittal, Pooja Guhan, Uttaran Bhattacharya +3