2 papers
cs.CL2026
OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing
Yilin Bao, Ziyao He, Zayden Yang
Scientific paper generation requires document-level planning and factual grounding, but current large language models, despite their strong local fluency, often fail in global stru…
cs.LG2024
Offline Reinforcement Learning for LLM Multi-Step Reasoning
Huaijie Wang, Shibo Hao, Hanze Dong +4
Improving the multi-step reasoning ability of large language models (LLMs) with offline reinforcement learning (RL) is essential for quickly adapting them to complex tasks. While D…