5 papers
Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
Ta Duc Huy, Trang Nguyen, Townim Chowdhury +5
Vision-language models can produce confident answers on visually ambiguous inputs, resulting in biased predictions. Common entropy-based methods, such as Semantic Entropy (SE), rel…
Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR
Yash Ingle, Jaival Chauhan, Ankit Yadav +1
Reinforcement learning with verifiable rewards (RLVR) has become a highly effective method for improving the reasoning abilities of Large Language Models (LLMs). Recent research sh…
Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
Ankit Yadav, Ta Duc Huy, Lingqiao Liu
Large-scale vision language pre-training has recently shown promise for no-reference image-quality assessment (NR-IQA), yet the relative merits of modern Vision Transformer foundat…
EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance
Ankit Yadav, Ta Duc Huy, Lingqiao Liu
In diffusion and flow-matching generative models, guidance techniques are widely used to improve sample quality and consistency. Classifier-free guidance (CFG) is the de facto choi…
Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models
Ankit Yadav, Lingqiao Liu, Yuankai Qi
This work investigates the capabilities of current vision-language models (VLMs) in visual understanding and attribute measurement of primitive shapes using a benchmark focused on…