3 papers
cs.CV2025
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
Zixuan Li, Lei Meng, Guoqing Chao +5
Cross-modal alignment is an effective approach to improving visual classification. Existing studies typically enforce a one-step mapping that uses deep neural networks to project t…
cs.CL2025
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
Zhuocheng Gong, Jian Guan, Wei Wu +2
Large language models (LLMs) have achieved remarkable success, yet aligning their generations with human preferences remains a critical challenge. Existing approaches to preference…
cs.CV2024
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
Zhendong Xiao, Changhao Chen, Shan Yang +1
Camera relocalization is pivotal in computer vision, with applications in AR, drones, robotics, and autonomous driving. It estimates 3D camera position and orientation (6-DoF) from…