From the 1 of 5 linked papers with an AI index.
5 papers
Conditioning Residuals for Diffusion Models via Representation Feedback
Weilai Xiang, Hongyu Yang, Di Huang +1
The paper introduces Conditioning Residuals, a lightweight feedback mechanism that injects compact feature summaries back into the conditioning embeddings of diffusion model backbo…
Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction
Chengxin Lv, Yihui Li, Hongyu Yang +1
3D semantic occupancy prediction is crucial for autonomous driving. While multi-modal fusion improves accuracy over vision-only methods, it typically relies on computationally expe…
APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformers
Zhuguanyu Wu, Jiayi Zhang, Jiaxin Chen +3
Vision Transformers (ViTs) have become one of the most commonly used backbones for vision tasks. Despite their remarkable performance, they often suffer significant accuracy drops…
Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning
Hanwen Zhong, Jiaxin Chen, Yutong Zhang +2
Multi-Task Learning (MTL) for Vision Transformer aims at enhancing the model capability by tackling multiple tasks simultaneously. Most recent works have predominantly focused on d…
Generating Editable Head Avatars with 3D Gaussian GANs
Guohao Li, Hongyu Yang, Yifang Men +4
Generating animatable and editable 3D head avatars is essential for various applications in computer vision and graphics. Traditional 3D-aware generative adversarial networks (GANs…