Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
Jianghan Shen, Siqi Luo, Xinyu Cheng +6
Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a promising paradigm for training agentic retrieval-augmented generation (RAG) systems from outcome-only superv…
cs.AI2026
Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion
ShiYing Huang, Liang Lin, Yuer Li +6
In the realm of multi-objective alignment for large language models, balancing disparate human preferences often manifests as a zero-sum conflict. Specifically, the intrinsic tensi…