3 papers
cs.CV2026
Identity-Aware Human-Object Interaction Motion Captioning
Yiming Wang, Yonghao Dang, Huilai Li +2
Existing human-object interaction (HOI) motion captioning methods typically describe what happens while referring to the subject using generic terms such as "a person" or "someone"…
cs.CV2025
DEFT-LLM: Disentangled Expert Feature Tuning for Micro-Expression Recognition
Ren Zhang, Huilai Li, Chao qi +4
Micro expression recognition (MER) is crucial for inferring genuine emotion. Applying a multimodal large language model (MLLM) to this task enables spatio-temporal analysis of faci…
cs.MM2025
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
Huilai Li, Yonghao Dang, Ying Xing +2
Dense audio-visual event localization (DAVE) aims to identify event categories and locate the temporal boundaries in untrimmed videos. Most studies only employ event-related semant…