2 papers
cs.CV2025
Unbiased Visual Reasoning with Controlled Visual Inputs
Zhaonan Li, Shijie Lu, Fei Wang +11
End-to-end Vision-language Models (VLMs) often answer visual questions by exploiting spurious correlations instead of causal visual evidence, and can become more shortcut-prone whe…
cs.GR2025
LatentEdit: Adaptive Latent Control for Consistent Semantic Editing
Siyi Liu, Weiming Chen, Yushun Tang +1
Diffusion-based Image Editing has achieved significant success in recent years. However, it remains challenging to achieve high-quality image editing while maintaining the backgrou…