multimodal question answering 1policy optimization 1post-training 1reinforcement learning 1visual grounding 1
From the 1 of 2 linked papers with an AI index.
2 papers
cs.AI2026
Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment
Harikrishnan P M, Goutham Vignesh, Ganesh Parab +4
The paper proposes Perception-RFT, a post‑training framework that uses Group Relative Policy Optimization to align visual features with grounding outputs for multimodal document qu…
cs.IR2026
DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation
Siddartha Reddy, Harikrishnan P M, Goutham Vignesh +2
Key Information Extraction (KIE) is vital for many document applications, but creating training datasets is traditionally a time-consuming manual process. We introduce DocAnnot, a…