2 papers
cs.CV2026
Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models
Zhikai Li, Yue Zhao, Edward Zhongwei Zhang +4
Reinforcement learning from human feedback (RLHF) effectively promotes preference alignment of text-to-image (T2I) diffusion models. To improve computational efficiency, direct pre…
cs.CR2026
Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models
Weidi Luo, Tianyu Lu, Qiming Zhang +8
Recent advances in multi-modal large reasoning models (MLRMs) have shown significant ability to interpret complex visual content. While these models enable impressive reasoning cap…