Publications (34)
RLBenchNet: The Right Network for the Right Reinforcement Learning Task
Ivan Smirnov, Shangding Gu
Agents' Last Exam
Yiyou Sun, Xinyang Han, Weichen Zhang +306
Multi-Agent Reinforcement Learning for Autonomous Driving: A Survey
Ruiqi Zhang, Jing Hou, Florian Walter +7
Settling the Variance of Multi-Agent Policy Gradients
Jakub Grudzien Kuba, Muning Wen, Yaodong Yang +5
AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond
Shangding Gu, Xiaohan Wang, Donghao Ying +9
A Circle Grid-based Approach for Obstacle Avoidance Motion Planning of Unmanned Surface Vehicles
Man Zhu, Changshi Xiao, Shangding Gu +2
Few-Shot Test-Time Optimization Without Retraining for Semiconductor Recipe Generation and Beyond
Shangding Gu, Donghao Ying, Ming Jin +4
Enhancing Efficiency of Safe Reinforcement Learning via Sample Manipulation
Shangding Gu, Laixi Shi, Yuhao Ding +4
Unmanned Surface Vehicle Path Planning from the Perspective of Multi-Modality Constraints: A Comprehensive Analysis
Chunhui Zhou, Shangding Gu, Yuanqiao Wen +4
Spreeze: High-Throughput Parallel Reinforcement Learning Framework
Jing Hou, Guang Chen, Ruiqi Zhang +3
Data Uniformity Improves Training Efficiency and More, with a Convergence Framework Beyond the NTK Regime
Yuqing Wang, Shangding Gu
A Human-Centered Safe Robot Reinforcement Learning Framework with Interactive Behaviors
Shangding Gu, Alap Kshirsagar, Yali Du +3
LLMs Should Express Uncertainty Explicitly
Junyu Guo, Shangding Gu, Ming Jin +2
Long Context, Less Focus: A Scaling Gap in LLMs Revealed through Privacy and Personalization
Shangding Gu
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
Junyu Guo, Zhi Zheng, Donghao Ying +4
TeaMs-RL: Teaching LLMs to Generate Better Instruction Datasets via Reinforcement Learning
Shangding Gu, Alois Knoll, Ming Jin
Safe and Balanced: A Framework for Constrained Multi-Objective Reinforcement Learning
Shangding Gu, Bilgehan Sel, Yuhao Ding +4
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
Weihao Xuan, Rui Yang, Heli Qi +29
MAPLE-Guard: Memory-Aware Link Enforcement Against Memory-Link Poisoning in Multi-Agent Systems
Wenjun Xiong, Yijin Zhou, Jiaqian Wang +6
SCPO: Safe Reinforcement Learning with Safety Critic Policy Optimization
Jaafar Mhamed, Shangding Gu
AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions
Xianyang Liu, Shangding Gu, Dawn Song
Agentic Web: Weaving the Next Web with AI Agents
Yingxuan Yang, Mulei Ma, Yuxuan Huang +15
Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation
Shangding Gu, Bilgehan Sel, Yuhao Ding +4
Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
Shangding Gu, Laixi Shi, Muning Wen +5
Multi-Agent Constrained Policy Optimisation
Shangding Gu, Jakub Grudzien Kuba, Munning Wen +6
Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study
Shangding Gu
From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
Shangding Gu
Safe Continual Domain Adaptation after Sim2Real Transfer of Reinforcement Learning Policies in Robotics
Josip Josifovski, Shangding Gu, Mohammadhossein Malmir +5
Safe Multi-Agent Reinforcement Learning with Bilevel Optimization in Autonomous Driving
Zhi Zheng, Shangding Gu
Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens
Peizhi Niu, Wenjie Qu, Shangding Gu +14
A Review of Safe Reinforcement Learning: Methods, Theory and Applications
Shangding Gu, Long Yang, Yali Du +4
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu +2
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
Yingxuan Yang, Chengrui Qu, Muning Wen +5
StyleBench: Evaluating thinking styles in Large Language Models
Junyu Guo, Shangding Gu, Ming Jin +2