3 papers
cs.CV2026
PC-Edit: Prompt-Contrastive Region Discovery and Region-Guided Editing
Jian Zhang, Zhijun Zhang
Replacing an object with one that differs in category or shape requires complete source removal, natural target formation unconstrained by the source silhouette, and preservation o…
eess.AS2026
UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition
Jinjie Fu, Hang Chen, Wu Guo +3
Audio-Visual speech recognition systems often degrade in real-world scenarios due to signal corruption and distribution shifts. To address this, we propose a unified uncertainty-mo…
cs.CV2026
AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation
Jian Zhang, Zhijun Zhang
Multi-Modal Diffusion Transformers (MM-DiTs) encode rich representations for training-free concept grounding, but existing attention-based methods often produce overlapping activat…