2 papers
cs.CV2026
FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Sparse Portrait Images
Jianjiang Yao, Ke Xian, Renxiang Dai +1
We present FFAvatar, a Transformer-based 3D Gaussian framework for fast construction of high-quality and animatable 4D head avatars from one or more reference portrait images. Unli…
cs.AI2026
Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning
Peng, Lee, Yin Zhang +9
Reinforcement Learning (RL) is an important paradigm for improving the reasoning capabilities of Vision-Language Models (VLMs). However, directly applying RL to rollout multimodal…