2 papers
cs.LG2026
DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation
Wei Zhang, Hongji Li, Song Sun +4
Advertising recommendation requires continuously tuning complex system parameters while balancing commercial returns and user experience. Recent work has introduced large language…
cs.CL2026
X-Coder: Advancing Competitive Programming with Synthetic Tasks, Solutions, and Tests
Jie Wu, Haoling Li, Xin Zhang +8
Competitive programming remains challenging for code LLMs. Despite recent progress, many training pipelines still depend on scarce real-world data, raising concerns about scalabili…