3 papers
cs.LG2026
Trust Regions Sell, But Who's Buying? Overlap Geometry as an Alternative Trust Region for Policy Optimization
Gaurish Trivedi, Alakh Sharma, Kartikey Singh Bhandari +4
Standard trust-region methods constrain policy updates via Kullback-Leibler (KL) divergence. However, KL controls only an average divergence and does not directly prevent rare, lar…
cs.AI2026
Actionable Advice from Reviews via Mixture of LoRA Experts: A Two-LLM Pipeline for Issue Extraction and Business Recommendations
Kartikey Singh Bhandari, Manav Ganesh, Yashwant Viswanathan +3
Customer reviews contain detailed, domain specific signals about service failures and user expectations, but converting this unstructured feedback into actionable business decision…
cs.LG2025
HAEPO: History-Aggregated Exploratory Policy Optimization
Gaurish Trivedi, Alakh Sharma, Kartikey Singh Bhandari +3
Exploration is essential in modern learning, from reinforcement learning environments with small neural policies to large language models (LLMs). Existing work, such as DPO, levera…