2 papers
cs.AI2026
Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models
Haitao Jiang, Wenbo Zhang, Jiarui Yao +3
Pre-trained Large Language Model (LLM) exhibits broad capabilities, yet, for specific tasks or domains their attainment of higher accuracy and more reliable reasoning generally dep…
cs.AI2026
PABU: Progress-Aware Belief Update for Efficient LLM Agents
Haitao Jiang, Lin Ge, Hengrui Cai +1
Large Language Model (LLM) agents commonly condition actions on full action-observation histories, which introduce task-irrelevant information that easily leads to redundant action…