activity
20242026
collaborators

16 papers

cs.CL2026

CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities

Daoyu Wang, Qingchuan Li, Mingyue Cheng +6

Reinforcement learning (RL) has become a key technique for improving the agentic capabilities of large language models (LLMs). Although critic-free methods such as GRPO are increas…

cs.IR2026

ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments

Tingyue Pan, Mingyue Cheng, Daoyu Wang +4

Academic paper search is a core step in scientific research, and LLM-based search agents are emerging as a promising paradigm for iterative, intent-driven literature exploration. H…

cs.LG2026

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Daoyu Wang, Mingyue Cheng, Qingchuan Li +3

Agentic reinforcement learning (RL) has become an important post-training paradigm for turning LLMs from static chatbots into interactive agents, giving rise to representative appl…

cs.LG2026

SocraticPO: Policy Optimization via Interactive Guidance

Zirui Liu, Jie Ouyang, Qi Liu +8

Reinforcement learning (RL) for large language models usually supervises reasoning with scalar outcome rewards, such as binary correctness. Such rewards provide an optimization dir…

cs.CL2026

Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning

Mingyue Cheng, Shuo Yu, Daoyu Wang +7

Large language models (LLMs) have rapidly evolved from single-turn text generators into the foundation of increasingly capable agents. As these agents take on more complex reasonin…

cs.CV2026

3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding

Yiping Chen, Jinpeng Li, Wenyu Ke +6

While multi-modality large language models excel in object-centric or indoor scenarios, scaling them to 3D city-scale environments remains a formidable challenge. To bridge this ga…