2 papers
cs.CL2026
On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data
Hongyuan Zhang, Xianda Guo, Yanlun Peng +6
Knowledge distillation offers an efficient route to transfer a task-adapted vision-language teacher to a compact student. The training target in current vision-language distillatio…
cs.CV2026
Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning
Qianlong Yang, Bowen Ye, Xianda Guo +4
Despite the progress of multimodal large language models (MLLMs), they continue to exhibit deficiencies in visual perception. Following visual instruction tuning, internal MLLM rep…