3 papers
cs.AI2025
UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
Chuang Chen, Xiao Sun, Zhi Liu
Visual emotion analysis holds significant research value in both computer vision and psychology. However, existing methods for visual emotion analysis suffer from limited generaliz…
cs.CV2025
Learning Speaker-Invariant Visual Features for Lipreading
Yu Li, Feng Xue, Shujie Li +4
Lipreading is a challenging cross-modal task that aims to convert visual lip movements into spoken text. Existing lipreading methods often extract visual features that include spea…
cs.CV2025
Structure-guided Diffusion Transformer for Low-Light Image Enhancement
Xiangchen Yin, Zhenda Yu, Longtao Jiang +4
While the diffusion transformer (DiT) has become a focal point of interest in recent years, its application in low-light image enhancement remains a blank area for exploration. Cur…