NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (181)

cs.CY2018

Vehicle Traffic Driven Camera Placement for Better Metropolis Security Surveillance

Yihui He, Xiaobo Ma, Xiapu Luo +4

cs.CL2026

Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents

Weikai Xu, Zhizheng Jiang, Yuxuan Liu +7

cs.GT2025

Efficient Last-iterate Convergence Algorithms in Solving Games

Linjian Meng, Youzhi Zhang, Zhenxing Ge +6

cs.AI2026

Task-Aware Exploration via a Predictive Bisimulation Metric

Dayang Liang, Ruihan Liu, Lipeng Wan +2

cs.LG2021

RMIX: Learning Risk-Sensitive Policies for Cooperative Reinforcement Learning Agents

Wei Qiu, Xinrun Wang, Runsheng Yu +5

cs.LG2021

L2E: Learning to Exploit Your Opponent

Zhe Wu, Kai Li, Enmin Zhao +5

cs.GT2024

Leveraging Team Correlation for Approximating Equilibrium in Two-Team Zero-Sum Games

Naming Liu, Mingzhi Wang, Youzhi Zhang +3

cs.AI2026

Science Earth: Towards A Planet-Scale Operating System for AI-Native Scientific Discovery

Zhe Zhao, Haibin Wen, Yingcheng Wu +10

cs.LG2023

IMM: An Imitative Reinforcement Learning Approach with Predictive Representation Learning for Automatic Market Making

Hui Niu, Siyuan Li, Jiahao Zheng +4

cs.MA2022

Off-Beat Multi-Agent Reinforcement Learning

Wei Qiu, Weixun Wang, Rundong Wang +7

cs.CL2026

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

Shuo He, Lang Feng, Xin Cheng +2

cs.CL2025

Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs

Zhiyi Lyu, Jianguo Huang, Yanchen Deng +2

q-fin.TR2024

A Multimodal Foundation Agent for Financial Trading: Tool-Augmented, Diversified, and Generalist

Wentao Zhang, Lingxuan Zhao, Haochong Xia +10

q-fin.TR2023

PRUDEX-Compass: Towards Systematic Evaluation of Reinforcement Learning in Financial Markets

Shuo Sun, Molei Qin, Xinrun Wang +1

cs.RO2026

Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation

Huanyu Li, Kun Lei, Sheng Zang +5

cond-mat.mtrl-sci2025

MATAI: A Generalist Machine Learning Framework for Property Prediction and Inverse Design of Advanced Alloys

Yanchen Deng, Chendong Zhao, Yixuan Li +10

cs.AI2026

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

Weihao Tan, Changjiu Jiang, Yu Duan +5

cs.LG2022

Mitigating Neural Network Overconfidence with Logit Normalization

Hongxin Wei, Renchunzi Xie, Hao Cheng +3

cs.AI2021

Pretrained Cost Model for Distributed Constraint Optimization Problems

Yanchen Deng, Shufeng Kong, Bo An

cs.AI2025

Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds

Weihao Tan, Xiangyang Li, Yunhao Fang +11

cs.LG2025

Generative Auto-Bidding with Value-Guided Explorations

Jingtong Gao, Yewen Li, Shuai Mao +8

q-fin.TR2022

Quantitative Stock Investment by Routing Uncertainty-Aware Trading Experts: A Multi-Task Learning Approach

Shuo Sun, Rundong Wang, Bo An

cs.LG2026

Adversarial Dual On-Policy Distillation from Expressive Teacher

Zhenglin Wan, Jingxuan Wu, Xingrui Yu +5

cs.MA2025

MF-LLM: Simulating Population Decision Dynamics via a Mean-Field Large Language Model Framework

Qirui Mi, Mengyue Yang, Xiangning Yu +6

cs.LG2026

Bayesian Robust Financial Trading with Adversarial Synthetic Market Data

Haochong Xia, Simin Li, Ruixiao Xu +7

cs.LG2023

In Defense of Softmax Parametrization for Calibrated and Consistent Learning to Defer

Yuzhou Cao, Hussein Mozannar, Lei Feng +2

cs.GT2018

On the Inducibility of Stackelberg Equilibrium for Security Games

Qingyu Guo, Jiarui Gan, Fei Fang +3

cond-mat.mtrl-sci2026

Autonomous Multi-objective Alloy Design through Simulation-guided Optimization

Penghui Yang, Chendong Zhao, Bijun Tang +11

cs.AI2024

Grasper: A Generalist Pursuer for Pursuit-Evasion Problems

Pengdeng Li, Shuxin Li, Xinrun Wang +5

cs.SI2021

Contingency-Aware Influence Maximization: A Reinforcement Learning Approach

Haipeng Chen, Wei Qiu, Han-Ching Ou +2

cs.AI2026

On the Provable Performance Guarantee of Efficient Reasoning Models

Hao Zeng, Jianguo Huang, Bingyi Jing +2

cs.MA2025

A Survey on Trustworthy LLM Agents: Threats and Countermeasures

Miao Yu, Fanci Meng, Xinyun Zhou +9

cs.AI2024

Synapse: Trajectory-as-Exemplar Prompting with Memory for Computer Control

Longtao Zheng, Rundong Wang, Xinrun Wang +1

cs.CR2025

A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment

Kun Wang, Guibin Zhang, Zhenhong Zhou +100

cs.LG2025

Leveraging Gradients for Unsupervised Accuracy Estimation under Distribution Shift

Renchunzi Xie, Ambroise Odonnat, Vasilii Feofanov +3

cs.LG2023

Regression with Cost-based Rejection

Xin Cheng, Yuzhou Cao, Haobo Wang +3

cs.LG2026

Training Diffusion Policies via Prior-Mapping Co-Evolution

Chubin Zhang, Zhenglin Wan, Feng Chen +7

cs.AI2025

AgentStudio: A Toolkit for Building General Virtual Agents

Longtao Zheng, Zhiyuan Huang, Zhenghai Xue +3

q-fin.TR2026

AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models

Wentao Zhang, Mingxuan Zhao, Jincheng Gao +5

cs.IR2023

PrefRec: Recommender Systems with Human Preferences for Reinforcing Long-term User Engagement

Wanqi Xue, Qingpeng Cai, Zhenghai Xue +6

cs.AI2021

Deep Stock Trading: A Hierarchical Reinforcement Learning Framework for Portfolio Optimization and Order Execution

Rundong Wang, Hongxin Wei, Bo An +2

cs.LG2026

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

Shuo He, Lang Feng, Qi Wei +3

cs.LG2023

On the Importance of Feature Separability in Predicting Out-Of-Distribution Error

Renchunzi Xie, Hongxin Wei, Lei Feng +2

cs.AI2026

AgentOrchestra: Orchestrating Multi-Agent Intelligence with the Tool-Environment-Agent(TEA) Protocol

Wentao Zhang, Liang Zeng, Yuzhen Xiao +7

cs.LG2025

Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning

Lang Feng, Weihao Tan, Zhiyi Lyu +5

cs.AI2026

GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization

Yanchen Deng, Xinrun Wang, Bo An

cs.DC2020

SpotTune: Leveraging Transient Resources for Cost-efficient Hyper-parameter Tuning in the Public Cloud

Yan Li, Bo An, Junming Ma +3

cs.LG2026

Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping

Jianxiong Zhang, Bing Guo, Yuming Jiang +3

cs.LG2024

State Regularized Policy Optimization on Data with Dynamics Shift

Zhenghai Xue, Qingpeng Cai, Shuchang Liu +4

cs.NE2025

DHEvo: Data-Algorithm Based Heuristic Evolution for Generalizable MILP Solving

Zhihao Zhang, Siyuan Li, Chenxi Li +6

cs.LG2024

Resisting Stochastic Risks in Diffusion Planners with the Trajectory Aggregation Tree

Lang Feng, Pengjie Gu, Bo An +1

cs.LG2024

Market-GAN: Adding Control to Financial Market Data Generation with Semantic Context

Haochong Xia, Shuo Sun, Xinrun Wang +1

cs.GT2021

Computing Ex Ante Coordinated Team-Maxmin Equilibria in Zero-Sum Multiplayer Extensive-Form Games

Youzhi Zhang, Bo An, Jakub Černý

cs.CV2026

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

Jiaxing Li, Kai Zou, Cindy Zhou +7

The paper studies autoregressive video distillation, showing that aligning the student model’s mode coverage with the teacher’s distribution improves generation quality and diversi…

#video distillation#autoregressive models#mode covering#distribution matching
cs.CL2026

Self-Debias: Self-correcting for Debiasing Large Language Models

Xuan Feng, Shuai Zhao, Luwei Xiao +2

cs.IR2025

AURO: Reinforcement Learning for Adaptive User Retention Optimization in Recommender Systems

Zhenghai Xue, Qingpeng Cai, Bin Yang +4

cs.LG2023

Partial-Label Regression

Xin Cheng, Deng-Bao Wang, Lei Feng +2

cs.AI2020

Complexity and Algorithms for Exploiting Quantal Opponents in Large Two-Player Games

David Milec, Jakub Černý, Viliam Lisý +1

cs.AI2026

CaveAgent: Transforming LLMs into Stateful Runtime Operators

Maohao Ran, Zhenglin Wan, Cooper Lin +21

cs.CL2026

LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting

Yewen Li, Zhiyi Lyu, Peng Jiang +3

cs.CL2026

REAR: Test-time Preference Realignment through Reward Decomposition

Fuxiang Zhang, Pengcheng Wang, Chenran Li +6

cs.CL2026

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification

Penghui Yang, Cunxiao Du, Fengzhuo Zhang +4

cs.AI2019

Competitive Bridge Bidding with Deep Neural Networks

Jiang Rong, Tao Qin, Bo An

physics.optics2023

Retrieving positions of closely packed sub-wavelength nanoparticles from their diffraction patterns

Benquan Wang, Ruyi An, Eng Aik Chan +6

cs.LG2019

Collaboration based Multi-Label Learning

Lei Feng, Bo An, Shuo He

cs.AI2022

Deep Attentive Belief Propagation: Integrating Reasoning and Learning for Solving Constraint Optimization Problems

Yanchen Deng, Shufeng Kong, Caihua Liu +1

cs.LG2026

Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems

Lang Feng, Longtao Zheng, Shuo He +2

cs.AI2020

Learning Behaviors with Uncertain Human Feedback

Xu He, Haipeng Chen, Bo An

cs.AI2026

Autogenesis: A Self-Evolving Agent Protocol

Wentao Zhang, Zhe Zhao, Haibin Wen +4

cs.GT2024

Computing Ex Ante Equilibrium in Heterogeneous Zero-Sum Team Games

Naming Liu, Mingzhi Wang, Xihuai Wang +5

stat.ML2021

Learning from Similarity-Confidence Data

Yuzhou Cao, Lei Feng, Yitian Xu +3

cs.LG2022

On the Robustness of Average Losses for Partial-Label Learning

Jiaqi Lv, Biao Liu, Lei Feng +6

cs.IR2023

ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor

Wanqi Xue, Qingpeng Cai, Ruohan Zhan +4

cs.CL2026

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

Kun Huang, Weikai Xu, Yuxuan Liu +6

cs.LG2025

Group-in-Group Policy Optimization for LLM Agent Training

Lang Feng, Zhenghai Xue, Tingcong Liu +1

cs.LG2024

Double Oracle Neural Architecture Search for Game Theoretic Deep Learning Models

Aye Phyu Phyu Aung, Xinrun Wang, Ruiyu Wang +4

cs.AI2026

GraphChase: A Platform and Benchmark for Urban Network Security Games

Shuxin Zhuang, Shuxin Li, Tianji Yang +4

cs.AI2024

Cradle: Empowering Foundation Agents Towards General Computer Control

Weihao Tan, Wentao Zhang, Xinrun Xu +25

cs.GT2019

Social Cost Guarantees in Smart Route Guidance

Paolo Serafino, Carmine Ventre, Long Tran-Thanh +3

cs.RO2026

Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation

Siyuan Li, Jiani Lu, Yu Song +3

cs.CL2026

Where Detectors Fail: Closing the Tail-Domain Gap with Expert-Guided Mutual Distillation

Xuan Feng, Guihong Liu, Tianlong Gu +5

The paper introduces Expert-Guided Mutual Distillation (EGMD), a method that improves multimodal fake news detection across domains by calibrating input coherence, aligning domain…

#fake news detection#multimodal learning#domain adaptation#knowledge distillation
cs.LG2023

Weakly Supervised Regression with Interval Targets

Xin Cheng, Yuzhou Cao, Ximing Li +2

cs.LG2026

A Survey of Continual Reinforcement Learning

Chaofan Pan, Xin Yang, Yanhua Li +4

cs.MA2026

DEpiABS: Differentiable Epidemic Agent-Based Simulator

Zhijian Gao, Shuxin Li, Bo An

cs.LG2024

True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning

Weihao Tan, Wentao Zhang, Shanqi Liu +3

cs.CL2025

Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation

Zhiyuan Hu, Shiyun Xiong, Yifan Zhang +5

cs.LG2025

FineFT: Efficient and Risk-Aware Ensemble Reinforcement Learning for Futures Trading

Molei Qin, Xinyu Cai, Yewen Li +5

cs.MA2025

Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning

Simin Li, Zihao Mao, Hanxiao Li +13

cs.LG2021

Open-set Label Noise Can Improve Robustness Against Inherent Label Noise

Hongxin Wei, Lue Tao, Renchunzi Xie +1

cs.CV2024

MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation

Longtao Zheng, Yifan Zhang, Hanzhong Guo +6

cs.LG2020

Contextual User Browsing Bandits for Large-Scale Online Mobile Recommendation

Xu He, Bo An, Yanghua Li +4

stat.ML2024

Resultant: Incremental Effectiveness on Likelihood for Unsupervised Out-of-Distribution Detection

Yewen Li, Chaojie Wang, Xiaobo Xia +6

cs.RO2026

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

Tingcong Liu, Tongshun Chen, Siyi Ma +6

The paper presents a framework that translates open‑vocabulary commands from a large language model into feasible motions for an elephant‑inspired soft‑trunk robot using lightweigh…

#soft robotics#continuum manipulators#human-robot interaction#semantic grounding
cs.RO2026

SPARC: Spatial-Aware Path Planning via Attentive Agent Communication

Sayang Mu, Xiangyu Wu, Bo An

cs.CR2022

NSGZero: Efficiently Learning Non-Exploitable Policy in Large-Scale Network Security Games with Neural Monte Carlo Tree Search

Wanqi Xue, Bo An, Chai Kiat Yeo

cs.LG2020

Learning to Collaborate in Multi-Module Recommendation via Multi-Agent Reinforcement Learning without Communication

Xu He, Bo An, Yanghua Li +6

cs.AI2024

Self-adaptive PSRO: Towards an Automatic Population-based Game Solver

Pengdeng Li, Shuxin Li, Chang Yang +4

cs.IR2020

Personalized Adaptive Meta Learning for Cold-start User Preference Prediction

Runsheng Yu, Yu Gong, Xu He +4

q-fin.TR2023

EarnHFT: Efficient Hierarchical Reinforcement Learning for High Frequency Trading

Molei Qin, Shuo Sun, Wentao Zhang +3

cs.IT2025

Joint Waveform Design for MIMO-OFDM DFRC Systems

Tianchen Liu, Yifei Liu, Liang Wu +4