Publications (181)
Vehicle Traffic Driven Camera Placement for Better Metropolis Security Surveillance
Yihui He, Xiaobo Ma, Xiapu Luo +4
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
Weikai Xu, Zhizheng Jiang, Yuxuan Liu +7
Efficient Last-iterate Convergence Algorithms in Solving Games
Linjian Meng, Youzhi Zhang, Zhenxing Ge +6
Task-Aware Exploration via a Predictive Bisimulation Metric
Dayang Liang, Ruihan Liu, Lipeng Wan +2
RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents
Wei Qiu, Xinrun Wang, Runsheng Yu +5
L2E: Learning to Exploit Your Opponent
Zhe Wu, Kai Li, Enmin Zhao +5
Leveraging Team Correlation for Approximating Equilibrium in Two-Team Zero-Sum Games
Naming Liu, Mingzhi Wang, Youzhi Zhang +3
Science Earth: Towards A Planet-Scale Operating System for AI-Native Scientific Discovery
Zhe Zhao, Haibin Wen, Yingcheng Wu +10
IMM: An Imitative Reinforcement Learning Approach with Predictive Representation Learning for Automatic Market Making
Hui Niu, Siyuan Li, Jiahao Zheng +4
Off-Beat Multi-Agent Reinforcement Learning
Wei Qiu, Weixun Wang, Rundong Wang +7
Online Causal Kalman Filtering for Stable and Effective Policy Optimization
Shuo He, Lang Feng, Xin Cheng +2
Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs
Zhiyi Lyu, Jianguo Huang, Yanchen Deng +2
A Multimodal Foundation Agent for Financial Trading: Tool-Augmented, Diversified, and Generalist
Wentao Zhang, Lingxuan Zhao, Haochong Xia +10
PRUDEX-Compass: Towards Systematic Evaluation of Reinforcement Learning in Financial Markets
Shuo Sun, Molei Qin, Xinrun Wang +1
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
Huanyu Li, Kun Lei, Sheng Zang +5
MATAI: A Generalist Machine Learning Framework for Property Prediction and Inverse Design of Advanced Alloys
Yanchen Deng, Chendong Zhao, Yixuan Li +10
StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley
Weihao Tan, Changjiu Jiang, Yu Duan +5
Mitigating Neural Network Overconfidence with Logit Normalization
Hongxin Wei, Renchunzi Xie, Hao Cheng +3
Pretrained Cost Model for Distributed Constraint Optimization Problems
Yanchen Deng, Shufeng Kong, Bo An
Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds
Weihao Tan, Xiangyang Li, Yunhao Fang +11
Generative Auto-Bidding with Value-Guided Explorations
Jingtong Gao, Yewen Li, Shuai Mao +8
Quantitative Stock Investment by Routing Uncertainty-Aware Trading Experts: A Multi-Task Learning Approach
Shuo Sun, Rundong Wang, Bo An
Adversarial Dual On-Policy Distillation from Expressive Teacher
Zhenglin Wan, Jingxuan Wu, Xingrui Yu +5
MF-LLM: Simulating Population Decision Dynamics via a Mean-Field Large Language Model Framework
Qirui Mi, Mengyue Yang, Xiangning Yu +6
Bayesian Robust Financial Trading with Adversarial Synthetic Market Data
Haochong Xia, Simin Li, Ruixiao Xu +7
In Defense of Softmax Parametrization for Calibrated and Consistent Learning to Defer
Yuzhou Cao, Hussein Mozannar, Lei Feng +2
On the Inducibility of Stackelberg Equilibrium for Security Games
Qingyu Guo, Jiarui Gan, Fei Fang +3
Autonomous Multi-objective Alloy Design through Simulation-guided Optimization
Penghui Yang, Chendong Zhao, Bijun Tang +11
Grasper: A Generalist Pursuer for Pursuit-Evasion Problems
Pengdeng Li, Shuxin Li, Xinrun Wang +5
Contingency-Aware Influence Maximization: A Reinforcement Learning Approach
Haipeng Chen, Wei Qiu, Han-Ching Ou +2
On the Provable Performance Guarantee of Efficient Reasoning Models
Hao Zeng, Jianguo Huang, Bingyi Jing +2
A Survey on Trustworthy LLM Agents: Threats and Countermeasures
Miao Yu, Fanci Meng, Xinyun Zhou +9
Synapse: Trajectory-as-Exemplar Prompting with Memory for Computer Control
Longtao Zheng, Rundong Wang, Xinrun Wang +1
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
Kun Wang, Guibin Zhang, Zhenhong Zhou +100
Leveraging Gradients for Unsupervised Accuracy Estimation under Distribution Shift
Renchunzi Xie, Ambroise Odonnat, Vasilii Feofanov +3
Regression with Cost-based Rejection
Xin Cheng, Yuzhou Cao, Haobo Wang +3
Training Diffusion Policies via Prior-Mapping Co-Evolution
Chubin Zhang, Zhenglin Wan, Feng Chen +7
AgentStudio: A Toolkit for Building General Virtual Agents
Longtao Zheng, Zhiyuan Huang, Zhenghai Xue +3
AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models
Wentao Zhang, Mingxuan Zhao, Jincheng Gao +5
PrefRec: Recommender Systems with Human Preferences for Reinforcing Long-term User Engagement
Wanqi Xue, Qingpeng Cai, Zhenghai Xue +6
Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution
Rundong Wang, Hongxin Wei, Bo An +2
Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
Shuo He, Lang Feng, Qi Wei +3
On the Importance of Feature Separability in Predicting Out-Of-Distribution Error
Renchunzi Xie, Hongxin Wei, Lei Feng +2
AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol
Wentao Zhang, Liang Zeng, Yuzhen Xiao +7
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
Lang Feng, Weihao Tan, Zhiyi Lyu +5
GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization
Yanchen Deng, Xinrun Wang, Bo An
SpotTune: Leveraging Transient Resources for Cost-efficient Hyper-parameter Tuning in the Public Cloud
Yan Li, Bo An, Junming Ma +3
Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping
Jianxiong Zhang, Bing Guo, Yuming Jiang +3
State Regularized Policy Optimization on Data with Dynamics Shift
Zhenghai Xue, Qingpeng Cai, Shuchang Liu +4
DHEvo: Data-Algorithm Based Heuristic Evolution for Generalizable MILP Solving
Zhihao Zhang, Siyuan Li, Chenxi Li +6
Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree
Lang Feng, Pengjie Gu, Bo An +1
Market-GAN: Adding Control to Financial Market Data Generation with Semantic Context
Haochong Xia, Shuo Sun, Xinrun Wang +1
Computing Ex Ante Coordinated Team-Maxmin Equilibria in Zero-Sum Multiplayer Extensive-Form Games
Youzhi Zhang, Bo An, Jakub Äerný
DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
Jiaxing Li, Kai Zou, Cindy Zhou +7
The paper studies autoregressive video distillation, showing that aligning the student model’s mode coverage with the teacher’s distribution improves generation quality and diversi…
Self-Debias: Self-correcting for Debiasing Large Language Models
Xuan Feng, Shuai Zhao, Luwei Xiao +2
AURO: Reinforcement Learning for Adaptive User Retention Optimization in Recommender Systems
Zhenghai Xue, Qingpeng Cai, Bin Yang +4
Partial-Label Regression
Xin Cheng, Deng-Bao Wang, Lei Feng +2
Complexity and Algorithms for Exploiting Quantal Opponents in Large Two-Player Games
David Milec, Jakub Äerný, Viliam Lisý +1
CaveAgent: Transforming LLMs into Stateful Runtime Operators
Maohao Ran, Zhenglin Wan, Cooper Lin +21
LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
Yewen Li, Zhiyi Lyu, Peng Jiang +3
REAR: Test-time Preference Realignment through Reward Decomposition
Fuxiang Zhang, Pengcheng Wang, Chenran Li +6
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
Penghui Yang, Cunxiao Du, Fengzhuo Zhang +4
Competitive Bridge Bidding with Deep Neural Networks
Jiang Rong, Tao Qin, Bo An
Retrieving positions of closely packed sub-wavelength nanoparticles from their diffraction patterns
Benquan Wang, Ruyi An, Eng Aik Chan +6
Collaboration based Multi-Label Learning
Lei Feng, Bo An, Shuo He
Deep Attentive Belief Propagation: Integrating Reasoning and Learning for Solving Constraint Optimization Problems
Yanchen Deng, Shufeng Kong, Caihua Liu +1
Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems
Lang Feng, Longtao Zheng, Shuo He +2
Learning Behaviors with Uncertain Human Feedback
Xu He, Haipeng Chen, Bo An
Autogenesis: A Self-Evolving Agent Protocol
Wentao Zhang, Zhe Zhao, Haibin Wen +4
Computing Ex Ante Equilibrium in Heterogeneous Zero-Sum Team Games
Naming Liu, Mingzhi Wang, Xihuai Wang +5
Learning from Similarity-Confidence Data
Yuzhou Cao, Lei Feng, Yitian Xu +3
On the Robustness of Average Losses for Partial-Label Learning
Jiaqi Lv, Biao Liu, Lei Feng +6
ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor
Wanqi Xue, Qingpeng Cai, Ruohan Zhan +4
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
Kun Huang, Weikai Xu, Yuxuan Liu +6
Group-in-Group Policy Optimization for LLM Agent Training
Lang Feng, Zhenghai Xue, Tingcong Liu +1
Double Oracle Neural Architecture Search for Game Theoretic Deep Learning Models
Aye Phyu Phyu Aung, Xinrun Wang, Ruiyu Wang +4
GraphChase: A Platform and Benchmark for Urban Network Security Games
Shuxin Zhuang, Shuxin Li, Tianji Yang +4
Cradle: Empowering Foundation Agents Towards General Computer Control
Weihao Tan, Wentao Zhang, Xinrun Xu +25
Social Cost Guarantees in Smart Route Guidance
Paolo Serafino, Carmine Ventre, Long Tran-Thanh +3
Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation
Siyuan Li, Jiani Lu, Yu Song +3
Where Detectors Fail: Closing the Tail-Domain Gap with Expert-Guided Mutual Distillation
Xuan Feng, Guihong Liu, Tianlong Gu +5
The paper introduces Expert-Guided Mutual Distillation (EGMD), a method that improves multimodal fake news detection across domains by calibrating input coherence, aligning domain…
Weakly Supervised Regression with Interval Targets
Xin Cheng, Yuzhou Cao, Ximing Li +2
A Survey of Continual Reinforcement Learning
Chaofan Pan, Xin Yang, Yanhua Li +4
DEpiABS: Differentiable Epidemic Agent-Based Simulator
Zhijian Gao, Shuxin Li, Bo An
True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning
Weihao Tan, Wentao Zhang, Shanqi Liu +3
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
Zhiyuan Hu, Shiyun Xiong, Yifan Zhang +5
FineFT: Efficient and Risk-Aware Ensemble Reinforcement Learning for Futures Trading
Molei Qin, Xinyu Cai, Yewen Li +5
Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning
Simin Li, Zihao Mao, Hanxiao Li +13
Open-set Label Noise Can Improve Robustness Against Inherent Label Noise
Hongxin Wei, Lue Tao, Renchunzi Xie +1
MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation
Longtao Zheng, Yifan Zhang, Hanzhong Guo +6
Contextual User Browsing Bandits for Large-Scale Online Mobile Recommendation
Xu He, Bo An, Yanghua Li +4
Resultant: Incremental Effectiveness on Likelihood for Unsupervised Out-of-Distribution Detection
Yewen Li, Chaojie Wang, Xiaobo Xia +6
Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching
Tingcong Liu, Tongshun Chen, Siyi Ma +6
The paper presents a framework that translates open‑vocabulary commands from a large language model into feasible motions for an elephant‑inspired soft‑trunk robot using lightweigh…
SPARC: Spatial-Aware Path Planning via Attentive Agent Communication
Sayang Mu, Xiangyu Wu, Bo An
NSGZero: Efficiently Learning Non-Exploitable Policy in Large-Scale Network Security Games with Neural Monte Carlo Tree Search
Wanqi Xue, Bo An, Chai Kiat Yeo
Learning to Collaborate in Multi-Module Recommendation via Multi-Agent Reinforcement Learning without Communication
Xu He, Bo An, Yanghua Li +6
Self-adaptive PSRO: Towards an Automatic Population-based Game Solver
Pengdeng Li, Shuxin Li, Chang Yang +4
Personalized Adaptive Meta Learning for Cold-start User Preference Prediction
Runsheng Yu, Yu Gong, Xu He +4
EarnHFT: Efficient Hierarchical Reinforcement Learning for High Frequency Trading
Molei Qin, Shuo Sun, Wentao Zhang +3
Joint Waveform Design for MIMO-OFDM DFRC Systems
Tianchen Liu, Yifei Liu, Liang Wu +4