3 papers
cs.CV2026
Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding
Junyi Hu, Tian Bai, Fengyi Wu +7
Referring Expression Comprehension (REC) is commonly studied under dataset-specific fine-tuning, resulting in specialist models with limited cross-dataset generalization. In this w…
cs.CV2026
PHCT: Plug-and-Play Hierarchical C2F Transformer for Multi-Scale Feature Fusion
Junyi Hu, Tian Bai, Fengyi Wu +2
Feature fusion plays a pivotal role in achieving high performance in vision models, yet existing attention-based fusion techniques often suffer from substantial computational overh…
cs.CV2026
ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding
Junyi Hu, Tian Bai, Fengyi Wu +3
Open-vocabulary grounding requires accurate vision-language alignment under weak supervision, yet existing methods either rely on global sentence embeddings that lack fine-grained…