2 papers
cs.CL2026
UniPolicy: Unified Objective-Specific Policies for Generative Search Advertising
Kun Yao, Yuhang Zhou, Yichi Zhang +6
Search advertising connects user intent with commercial content and plays a critical role in platform monetization. Recent systems typically align pretrained generative models with…
cs.AI2026
AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD
Yang Xu, Kun Yao, Yiming Deng +3
Reinforcement Learning with Verifiable Rewards (RLVR) has demonstrated notable success in enhancing the reasoning performance of large language models (LLMs). However, recent studi…