NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (34)

cs.LG2025

RLBenchNet: The Right Network for the Right Reinforcement Learning Task

Ivan Smirnov, Shangding Gu

cs.AI2026

Agents' Last Exam

Yiyou Sun, Xinyang Han, Weichen Zhang +306

cs.AI2024

Multi-Agent Reinforcement Learning for Autonomous Driving: A Survey

Ruiqi Zhang, Jing Hou, Florian Walter +7

cs.LG2022

Settling the Variance of Multi-Agent Policy Gradients

Jakub Grudzien Kuba, Muning Wen, Yaodong Yang +5

cs.LG2025

AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond

Shangding Gu, Xiaohan Wang, Donghao Ying +9

cs.RO2022

A Circle Grid-based Approach for Obstacle Avoidance Motion Planning of Unmanned Surface Vehicles

Man Zhu, Changshi Xiao, Shangding Gu +2

cs.LG2025

Few-Shot Test-Time Optimization Without Retraining for Semiconductor Recipe Generation and Beyond

Shangding Gu, Donghao Ying, Ming Jin +4

cs.LG2024

Enhancing Efficiency of Safe Reinforcement Learning via Sample Manipulation

Shangding Gu, Laixi Shi, Yuhao Ding +4

cs.RO2025

Unmanned Surface Vehicle Path Planning from the Perspective of Multi-Modality Constraints: A Comprehensive Analysis

Chunhui Zhou, Shangding Gu, Yuanqiao Wen +4

cs.LG2023

Spreeze: High-Throughput Parallel Reinforcement Learning Framework

Jing Hou, Guang Chen, Ruiqi Zhang +3

cs.LG2025

Data Uniformity Improves Training Efficiency and More, with a Convergence Framework Beyond the NTK Regime

Yuqing Wang, Shangding Gu

cs.RO2023

A Human-Centered Safe Robot Reinforcement Learning Framework with Interactive Behaviors

Shangding Gu, Alap Kshirsagar, Yali Du +3

cs.LG2026

LLMs Should Express Uncertainty Explicitly

Junyu Guo, Shangding Gu, Ming Jin +2

cs.LG2026

Long Context, Less Focus: A Scaling Gap in LLMs Revealed through Privacy and Personalization

Shangding Gu

cs.LG2025

Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL

Junyu Guo, Zhi Zheng, Donghao Ying +4

cs.CL2025

TeaMs-RL: Teaching LLMs to Generate Better Instruction Datasets via Reinforcement Learning

Shangding Gu, Alois Knoll, Ming Jin

cs.AI2024

Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning

Shangding Gu, Bilgehan Sel, Yuhao Ding +4

cs.CL2025

MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation

Weihao Xuan, Rui Yang, Heli Qi +29

cs.MA2026

MAPLE-Guard: Memory-Aware Link Enforcement Against Memory-Link Poisoning in Multi-Agent Systems

Wenjun Xiong, Yijin Zhou, Jiaqian Wang +6

cs.LG2023

SCPO: Safe Reinforcement Learning with Safety Critic Policy Optimization

Jaafar Mhamed, Shangding Gu

cs.AI2026

AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions

Xianyang Liu, Shangding Gu, Dawn Song

cs.AI2025

Agentic Web: Weaving the Next Web with AI Agents

Yingxuan Yang, Mulei Ma, Yuxuan Huang +15

cs.LG2025

Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation

Shangding Gu, Bilgehan Sel, Yuhao Ding +4

cs.LG2025

Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning

Shangding Gu, Laixi Shi, Muning Wen +5

cs.AI2022

Multi-Agent Constrained Policy Optimisation

Shangding Gu, Jakub Grudzien Kuba, Munning Wen +6

cs.CL2025

Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study

Shangding Gu

cs.AI2026

From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

Shangding Gu

cs.RO2025

Safe Continual Domain Adaptation after Sim2Real Transfer of Reinforcement Learning Policies in Robotics

Josip Josifovski, Shangding Gu, Mohammadhossein Malmir +5

cs.RO2024

Safe Multi-Agent Reinforcement Learning with Bilevel Optimization in Autonomous Driving

Zhi Zheng, Shangding Gu

cs.CR2026

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

Peizhi Niu, Wenjie Qu, Shangding Gu +14

cs.AI2024

A Review of Safe Reinforcement Learning: Methods, Theory and Applications

Shangding Gu, Long Yang, Yali Du +4

cs.AI2026

Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu +2

cs.AI2026

Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity

Yingxuan Yang, Chengrui Qu, Muning Wen +5

cs.LG2026

StyleBench: Evaluating thinking styles in Large Language Models

Junyu Guo, Shangding Gu, Ming Jin +2