3 papers
cs.CV2026
Interpretability Transfer from Language to Vision via Sparse Autoencoders
Alexey Kravets, Da Li, Chuan Li +2
Recent advances in language model interpretability using sparse autoencoders (SAEs) have yet to effectively translate to the visual domain, mainly due to the difficulty and ambigui…
cs.CV2025
AttentionDrag: Exploiting Latent Correlation Knowledge in Pre-trained Diffusion Models for Image Editing
Biao Yang, Muqi Huang, Yuhui Zhang +8
Traditional point-based image editing methods rely on iterative latent optimization or geometric transformations, which are either inefficient in their processing or fail to captur…
cs.CV2025
A 2D Semantic-Aware Position Encoding for Vision Transformers
Xi Chen, Shiyang Zhou, Muqi Huang +9
Vision transformers have demonstrated significant advantages in computer vision tasks due to their ability to capture long-range dependencies and contextual relationships through s…