2 papers
cs.LG2026
Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR
Lirui Luo, Guoxi Zhang, Hongming Xu +3
Reinforcement learning with verifiable rewards (RLVR) commonly post-trains reasoning models on multiple tasks, while rerunning multitask RLVR (MTRL) as new tasks are added makes ca…
cs.AI2024
End-to-End Neuro-Symbolic Reinforcement Learning with Textual Explanations
Lirui Luo, Guoxi Zhang, Hongming Xu +3
Neuro-symbolic reinforcement learning (NS-RL) has emerged as a promising paradigm for explainable decision-making, characterized by the interpretability of symbolic policies. NS-RL…