Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
Shijie Zhang, Zheng Xiao, Shiyu Liu +7
Online reinforcement learning with verifiable rewards (RLVR) has become an effective paradigm for improving the reasoning abilities of large language models, but most methods still…
cs.AI2026
MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
Yifan Bao, Xinyu Xi, Xinyu Liu +8
Automated data science is a structured model-selection problem. A solution must choose data transformations, feature representations, architecture, training procedure, evaluation p…