most citedLanguage Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement

1 citations · 1 across the 4 of their papers we have counts for

collaborators

6 papers

eess.SY2026

ERFSL: An Efficient Reward Function Searcher via Language Models for Custom-Environment Multi-Objective Optimization (Student Abstract)

Guanwen Xie, Jingzehua Xu, Yiyuan Yang +2

We propose ERFSL, an efficient reward function searcher using large language models (LLMs) for custom-environment, multi-objective learning-based methods (LB). ERFSL generates rewa…

eess.SY2026

AoI-MDP: An AoI Optimized Markov Decision Process (Student Abstract)

Yimian Ding, Jingzehua Xu, Yiyuan Yang +3

Ocean exploration places high demands on autonomous underwater vehicles, especially when there's observation delay. We propose age of information optimized Markov decision process…

cs.LG20261 cited

Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement

Guanwen Xie, Jingzehua Xu, Yiyuan Yang +2

Achieving the effective design and improvement of reward functions in reinforcement learning (RL) tasks with complex custom environments and multiple requirements presents consider…

eess.SY2026

Enhancing Information Freshness: An AoI Optimized Markov Decision Process

Jingzehua Xu, Yimian Ding, Yiyuan Yang +2

Ocean exploration utilizing autonomous underwater vehicles (AUVs) via reinforcement learning (RL) has emerged as a significant research focus. However, underwater tasks have mostly…

cs.RO2025

Ocean Diviner: A Diffusion-Augmented Reinforcement Learning Framework for AUV Robust Control in Underwater Tasks

Jingzehua Xu, Guanwen Xie, Weiyi Liu +6

Autonomous Underwater Vehicles (AUVs) are essential for marine exploration, yet their control remains highly challenging due to nonlinear dynamics and uncertain environmental distu…

cs.LG2025

Imitating from auxiliary imperfect demonstrations via Adversarial Density Weighted Regression

Ziqi Zhang, Zifeng Zhuang, Jingzehua Xu +4

We propose a novel one-step supervised imitation learning (IL) framework called Adversarial Density Regression (ADR). This IL framework aims to correct the policy learned on unknow…