7 papers
Generative Auto-Bidding with Unified Modeling and Exploration
Mingming Zhang, Feiqing Zhuang, Na Li +7
Automated bidding is central to modern digital advertising. Early rule-based methods lacked adaptability, while subsequent Reinforcement Learning approaches modeled bidding as a Ma…
Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training
Peng Cui, Boyao Yang, Jun Zhu
Reinforcement Learning (RL) post-training has emerged as the dominant paradigm for eliciting mathematical reasoning in Large Language Models (LLMs), yet prevailing techniques such…
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
Yu Shang, Yinzhou Tang, Yiding Ma +22
World models have emerged as a central paradigm for embodied intelligence, enabling agents to predict action-conditioned future and reason about environmental dynamics. However, ex…
Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning
Peng Cui, Boyao Yang, Jun Zhu
Reinforcement learning post-training has substantially improved the reasoning accuracy of vision-language models, yet the resulting policies remain poorly calibrated. Terminal corr…
E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought
Meiqi Sun, Mingyu Li, Junxiong Zhu
Generative AI is widely used to create commercial posters. However, rapid advances in generation have outpaced automated quality assessment. Existing models emphasize generic esthe…
Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies
Mingming Zhang, Na Li, Zhuang Feiqing +8
With the rapid development of e-commerce, auto-bidding has become a key asset in optimizing advertising performance under diverse advertiser environments. The current approaches fo…