papers
Publications (19)
eess.AS2023
MIR-GAN: Refining Frame-Level Modality-Invariant Representations with Adversarial Network for Audio-Visual Speech Recognition
Yuchen Hu, Chen Chen, Ruizhe Li +2
cs.AI2025
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
Wentao Wang, Heqing Zou, Tianze Luo +8
cs.CV2025
HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding
Heqing Zou, Tianze Luo, Guiyang Xie +7
cs.SD2023
Unsupervised Noise adaptation using Data Simulation
Chen Chen, Yuchen Hu, Heqing Zou +2
cs.CV2024
Text-based Talking Video Editing with Cascaded Conditional Diffusion
Bo Han, Heqing Zou, Haoyang Li +2
cs.CV2023
UniS-MMC: Multimodal Classification via Unimodality-supervised Multimodal Contrastive Learning
Heqing Zou, Meng Shen, Chen Chen +3
eess.AS2023
Cross-Modal Global Interaction and Local Alignment for Audio-Visual Speech Recognition
Yuchen Hu, Ruizhe Li, Chen Chen +3
cs.AI2026
ICRL: Learning to Internalize Self-Critique with Reinforcement Learning
Jianbo Lin, Xiaomin Yu, Yi Xin +7
cs.SD2022
Interactive Audio-text Representation for Automated Audio Captioning with Contrastive Learning
Chen Chen, Nana Hou, Yuchen Hu +3
cs.CL2026
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
Haotian Wu, Shufan Jiang, Chios Chen +5
cs.CV2024
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
Heqing Zou, Tianze Luo, Guiyang Xie +8
cs.MM2023
Towards Balanced Active Learning for Multimodal Classification
Meng Shen, Yizheng Huang, Jianxiong Yin +3
eess.AS2023
Unifying Speech Enhancement and Separation with Gradient Modulation for End-to-End Noise-Robust Speech Separation
Yuchen Hu, Chen Chen, Heqing Zou +2
cs.CV2025
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
Ruizhe Chen, Zhiting Fan, Tianze Luo +7
cs.MM2024
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
Heqing Zou, Meng Shen, Yuchen Hu +3
cs.CL2025
Large Language Models Meet Contrastive Learning: Zero-Shot Emotion Recognition Across Languages
Heqing Zou, Fengmao Lv, Desheng Zheng +2
cs.CL2022
Self-critical Sequence Training for Automatic Speech Recognition
Chen Chen, Yuchen Hu, Nana Hou +3
cs.SD2022
Speech Emotion Recognition with Co-Attention based Multi-level Acoustic Information
Heqing Zou, Yuke Si, Chen Chen +2
cs.SD2023
Leveraging Modality-specific Representations for Audio-visual Speech Recognition via Reinforcement Learning
Chen Chen, Yuchen Hu, Qiang Zhang +3