collaborators

7 papers

cs.AI2026

Generative Auto-Bidding with Unified Modeling and Exploration

Mingming Zhang, Feiqing Zhuang, Na Li +7

Automated bidding is central to modern digital advertising. Early rule-based methods lacked adaptability, while subsequent Reinforcement Learning approaches modeled bidding as a Ma…

cs.LG2026

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

Peng Cui, Boyao Yang, Jun Zhu

Reinforcement Learning (RL) post-training has emerged as the dominant paradigm for eliciting mathematical reasoning in Large Language Models (LLMs), yet prevailing techniques such…

cs.RO2026

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

Yu Shang, Yinzhou Tang, Yiding Ma +22

World models have emerged as a central paradigm for embodied intelligence, enabling agents to predict action-conditioned future and reason about environmental dynamics. However, ex…

cs.LG2026

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

Peng Cui, Boyao Yang, Jun Zhu

Reinforcement learning post-training has substantially improved the reasoning accuracy of vision-language models, yet the resulting policies remain poorly calibrated. Terminal corr…

cs.CV2026

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

Meiqi Sun, Mingyu Li, Junxiong Zhu

Generative AI is widely used to create commercial posters. However, rapid advances in generation have outpaced automated quality assessment. Existing models emphasize generic esthe…

cs.LG2026

Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies

Mingming Zhang, Na Li, Zhuang Feiqing +8

With the rapid development of e-commerce, auto-bidding has become a key asset in optimizing advertising performance under diverse advertiser environments. The current approaches fo…