2 papers
cs.LG2026
Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking
Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma
Reinforcement learning (RL) allows vision-language-action (VLA) policies to generalize beyond their training distribution by optimizing directly for task success, but post-training…
cs.AI2025
Teaching LLMs to Plan: Logical Chain-of-Thought Instruction Tuning for Symbolic Planning
Pulkit Verma, Ngoc La, Anthony Favier +2
Large language models (LLMs) have demonstrated impressive capabilities across diverse tasks, yet their ability to perform structured symbolic planning remains limited, particularly…