4 papers
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
Qinwu Xu, Yifan Jiang, Haoyu Ren
Optical character recognition (OCR) and multilingual scene-text understanding remain challenging for multimodal large language models (MLLMs), particularly in real-world images con…
Visual Preference Optimization with Rubric Rewards
Ya-Qi Yu, Fangyu Hong, Xiangyang Qu +15
The effectiveness of Direct Preference Optimization (DPO) depends on preference data that reflect the quality differences that matter in multimodal tasks. Existing pipelines often…
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
Zekai Ye, Qiming Li, Xiaocheng Feng +6
While Reinforcement Learning from Verifiable Rewards (RLVR) has advanced reasoning in Large Vision-Language Models (LVLMs), prevailing frameworks suffer from a foundational methodo…
On-Device Continual Learning for Unsupervised Visual Anomaly Detection in Dynamic Manufacturing
Haoyu Ren, Kay Koehle, Kirill Dorofeev +1
In modern manufacturing, Visual Anomaly Detection (VAD) is essential for automated inspection and consistent product quality. Yet, increasingly dynamic and flexible production envi…