3 papers
cs.CL2026
Beyond Position Bias: Shifting Context Compression from Position-Driven to Semantic-Driven
Jiwei Tang, Zhijing Huang, Xinyu Zhang +5
Large Language Models (LLMs) have demonstrated exceptional performance across diverse tasks. However, their deployment in long-context scenarios faces high computational overhead a…
cs.CV2026
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
Huilai Li, Xiaomeng Di, Ying Xing +3
Weakly supervised Audio-Visual Video Parsing (AVVP) aims to recognize and temporally localize audio, visual, and audio-visual events in videos using only coarse-grained labels. Fac…
cs.CV2025
DEFT-LLM: Disentangled Expert Feature Tuning for Micro-Expression Recognition
Ren Zhang, Huilai Li, Chao qi +4
Micro expression recognition (MER) is crucial for inferring genuine emotion. Applying a multimodal large language model (MLLM) to this task enables spatio-temporal analysis of faci…