2 papers
cs.CV2026
SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation
Lingyu Xiong, Jinjin Shi, Xuran Xu +3
Vision Foundation Models (VFMs) have demonstrated impressive representational capabilities. However, adapting them to downstream tasks via full fine-tuning incurs prohibitive compu…
cs.CV2026
Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics
Yunlong Wang, Jinjin Shi, Wenbin Gao +3
Text-to-image diffusion models often face a severe trilemma in human portrait generation: text-image alignment, photorealism, and human-perceived aesthetics inherently inhibit one…