9.8k citations
- Chinese Academy of SciencesCN774 papers
- University of Chinese Academy of SciencesCN660 papers
- University of Science and Technology of ChinaCN646 papers
- Peking UniversityCN619 papers
- Istituto Nazionale di Fisica Nucleare, Laboratori Nazionali di FrascatiIT594 papers
- Centre National de la Recherche ScientifiqueFR584 papers
- Institute of High Energy PhysicsCN570 papers
- University of OxfordGB516 papers
- University of ManchesterGB483 papers
- Istituto Nazionale di Fisica Nucleare, Sezione di Roma IIT480 papers
- Rutherford Appleton LaboratoryGB477 papers
- Massachusetts Institute of TechnologyUS475 papers
323 papers · 1 filter
Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
Pengxu Chen, Yao Zhu, Guangming Zhu +4
Large vision-language models (LVLMs) have demonstrated remarkable capabilities in multimodal understanding. However, they remain prone to hallucinations, generating responses that…
NeuroPath: Brain-Inspired Dual-Pathway Graph Convolutional Networks for Skeleton-Based Action Recognition
Kanglei Zhou, Ruizhi Cai, Hubert P. H. Shum +2
Skeleton-based action recognition aims to recognize human actions from sequences of human joint coordinates. Most existing Spatial-Temporal Graph Convolutional Networks (STGCNs) ha…
HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion
Wenshuo Peng, Kaipeng Zhang
Video-to-audio (V2A) generation faces significant challenges in achieving precise temporal synchronization and high perceptual quality due to the complex, ambiguous relationship be…
DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse
Yuyang Chen, Runxin Zhong, Zan Zong +3
Recent advances in AI-generated content have driven widespread adoption of Diffusion Transformers (DiTs) for high-resolution, long-duration content generation. While parallelizatio…
Nexus: Native Mesh Generation with Diffusion
Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo +5
Generating high-quality triangle meshes is essential for film, gaming, and interactive 3D applications. Mainstream methods rely on mesh serialization and autoregressive processes,…
Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment
Kanglei Zhou, Ruizhi Cai, Xinning Wang +4
Action Quality Assessment (AQA) aims to evaluate how well a person performs a movement, which is essential in applications such as sports scoring, skill assessment, and healthcare.…