Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs
Yu-Yang Chen, Lan-Zhe Guo
Multimodal Large Language Models (MLLMs) demonstrate strong performance on standard visual question answering benchmarks, yet their scalability under controlled structural complexi…
cs.CV2025
Shift-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment
Song-Lin Lv, Yu-Yang Chen, Zhi Zhou +2
Vision-language models (VLMs), such as CLIP, adapt effectively to downstream tasks through prompt tuning, but fine-tuning can misalign predictive confidence and accuracy, particula…