2 papers
cs.LG2026
MDP-GRPO: Stabilized Group Relative Policy Optimization for Multi-Constraint Instruction Following
Mohammad Mahdi Salmani-Zarchi, Zahra Rahimi, Heshaam Faili +1
Reinforcement learning with verifiable rewards is ideal for multi-constraint instruction following, yet standard group-relative policy optimization (GRPO) becomes unstable under di…
cs.IR2025
Intelligent Scientific Literature Explorer using Machine Learning (ISLE)
Sina Jani, Arman Heidari, Amirmohammad Anvari +1
The rapid acceleration of scientific publishing has created substantial challenges for researchers attempting to discover, contextualize, and interpret relevant literature. Traditi…