4 papers
HaPRL: Human-Anchored Process Reinforcement Learning for Visual Search Agent
Zhangquan Chen, Yaoxin Niu, Xiang An +5
Multi-turn visual search agents answer questions about high-resolution images by iteratively deciding where to look. Reinforcement learning for these agents rewards only the final…
EviViT: Evidence-Adaptive Vision Transformers for Fine-Grained Perception
Yaoxin Niu, Zhangquan Chen, Yang Zhang +5
Fine-grained visual perception enables vision-language models to distinguish subtle attributes and ground their answers in visual evidence. In high-resolution scenes, processing th…
Improving Multi-View Reconstruction via Texture-Guided Gaussian-Mesh Joint Optimization
Zhejia Cai, Puhua Jiang, Shiwei Mao +2
Reconstructing real-world objects from multi-view images is essential for applications in 3D editing, AR/VR, and digital content creation. Existing methods typically prioritize eit…
ControlGS: Consistent Structural Compression Control for Deployment-Aware Gaussian Splatting
Fengdi Zhang, Yibao Sun, Hongkun Cao +1
3D Gaussian Splatting (3DGS) is a highly deployable real-time method for novel view synthesis. In practice, it requires a universal, consistent control mechanism that adjusts the t…