Showing cs.CLShow all
2 papers · 1 filter
cs.CL2025
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
Xiangchi Yuan, Xiang Chen, Tong Yu +4
Large Language Models (LLMs) show strong reasoning abilities, often amplified by Chain-of-Thought (CoT) prompting and reinforcement learning (RL). Although RL algorithms can substa…
cs.CL2025
Exploring Rewriting Approaches for Different Conversational Tasks
Md Mehrab Tanjim, Ryan A. Rossi, Mike Rimer +9
Conversational assistants often require a question rewriting algorithm that leverages a subset of past interactions to provide a more meaningful (accurate) answer to the user's que…