4 papers
CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning
Junru Song, Wenhao Zhang, Yang Yang +7
Target-oriented vision-and-language navigation (VLN) on aerial platforms is attracting growing attention for missions such as disaster rescue, infrastructure inspection, and securi…
Structured In-context Environment Scaling for Large Language Model Reasoning
Peng Yu, Zeyuan Zhao, Shao Zhang +3
Large language models (LLMs) have achieved significant advancements in reasoning capabilities through reinforcement learning (RL) via environmental exploration. As the intrinsic pr…
Sequence Pathfinder for Multi-Agent Pickup and Delivery in the Warehouse
Zeyuan Zhao, Chaoran Li, Shao Zhang +1
Multi-Agent Pickup and Delivery (MAPD) is a challenging extension of Multi-Agent Path Finding (MAPF), where agents are required to sequentially complete tasks with fixed-location p…
Towards Monotonic Improvement in In-Context Reinforcement Learning
Wenhao Zhang, Shao Zhang, Xihuai Wang +2
In-Context Reinforcement Learning (ICRL) has emerged as a promising paradigm for developing agents that can rapidly adapt to new tasks by leveraging past experiences as context, wi…