2 papers
cs.LG2026
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
Anas Barakat, Souradip Chakraborty, Khushbu Pahwa +1
Pass@k is a widely used performance metric for verifiable large language model tasks, including mathematical reasoning, code generation, and short-answer reasoning. It defines succ…
cs.LG2024
Independent Policy Mirror Descent for Markov Potential Games: Scaling to Large Number of Players
Pragnya Alatur, Anas Barakat, Niao He
Markov Potential Games (MPGs) form an important sub-class of Markov games, which are a common framework to model multi-agent reinforcement learning problems. In particular, MPGs in…