3 papers
cs.CL2026
Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
Xianlei Zhou, Xiangdi Meng, Yu He +7
Policy optimization (PO) for Large Language Models faces a stability--exploration trade-off, currently mediated by an action-side Policy-KL regularizer. This puts practitioners in…
cs.CL2026
A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)
Xianling Zhang
Conflicting objectives are general in RL alignment, and training on them data-efficiently is hard. Training a safety guard with RL means optimizing two objectives that conflict: ca…
cs.CL2026
Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction
Hangxuan Li, Renjun Jia, Xuezhang Wu +3
Effective features are crucial for predictive model performance, but creating them often requires domain expertise, limiting scalability across applications. We define feature engi…