21 papers · 1 filter
AViS-Mamba: Adaptive Visual Steering of Audio State-Space Dynamics for Violence Detection
Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh
Automatic violence detection from video is challenging because violent interactions may be distant, occluded, or only partially visible. Audio can provide complementary evidence fo…
FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection
Damith Chamalke Senadeera, Muhammad Awais, Shibo Li +2
The rapid proliferation of surveillance cameras has increased the demand for automated violence detection. While CNNs and Transformers have shown success in extracting spatio-tempo…
EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation
Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh +2
Text-to-image diffusion models power everyday creative tasks, but they still reproduce the demographic biases in their training data. On common prompts such as ``a photo of a nurse…
HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning
Awais Rauf, Ahmed Hasssan, Greg Slabaugh
Understanding long videos requires fine-grained perception and multi-step, higher-order reasoning over complex, long-range spatio-temporal dynamics. Vision-language models (VLMs) e…
Self-Learning Expression Deformations for Data-Efficient Gaussian Avatars
Jiahao Yang, Xiaohang Yang, Qing Wang +3
Modeling dynamic facial expressions using 3D Gaussian representations remains challenging due to their unstructured nature. Conventional Gaussian avatar pipelines require extensive…
ProtoPathway: Biologically Structured Prototype-Pathway Fusion for Multimodal Cancer Survival Prediction
Amaya Gallagher-Syed, Costantino Pitzalis, Myles J. Lewis +2
We introduce ProtoPathway, an interpretable-by-design multimodal framework for cancer survival prediction that unifies whole slide imaging and transcriptomics through encoders prod…