2 papers
cs.AI2026
EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment
Ruoxi Cheng, Haoxuan Ma, Teng Ma +1
Large Vision-Language Models (LVLMs) exhibit powerful reasoning capabilities but suffer sophisticated jailbreak vulnerabilities. Fundamentally, aligning LVLMs is not just a safety…
cs.CV2025
L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training
Li Li, Yingzhe Peng, Xu Yang +4
We propose a novel embedding-based captioning metric termed as L-CLIPScore that can be used for efficiently evaluating caption quality and training captioning model. L-CLIPScore is…