2 papers
cs.LG2026
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
Song Lai, Haohan Zhao, Rong Feng +9
Continual post-training (CPT) is a popular and effective technique for adapting foundation models like multimodal large language models to ever-evolving downstream tasks. While exi…
cs.CL2026
Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation
Geng Liu, Fei Zhu, Rong Feng +3
Multi-turn conversation has emerged as a predominant interaction paradigm for Large Language Models (LLMs). Users often employ follow-up questions to refine their intent, expecting…