activity
20242026
collaborators

10 papers

cs.LG2026

Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation

Qian Tan, Huaifei Liang, Xuanyu Zhu +2

On-policy distillation (OPD) provides dense teacher supervision along student-generated trajectories, but its online rollout process incurs substantial computational cost, particul…

cs.LG2026

MolGVR: A Chemistry-Grounded Framework for Text-to-Molecule Generation

Qian Tan, Xuanyu Zhu, Lei Jiang +3

Text-to-molecule generation is typically formulated as a one-shot sequence generation problem, where a model directly maps target descriptions to molecular representations. However…

cs.CL2026

Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search Agents

Jiayi Wu, Ruobing Xie, Zeqian Huang +6

Search agents achieve strong question-answering performance through multi-turn interactions with search engines, with Group Relative Policy Optimization (GRPO) being a widely used…

cs.CV2026

TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection

Lei Jiang, Chunzhao Xie, Tongxuan Liu +6

Large Vision-Language Models have demonstrated remarkable capabilities, yet they suffer from hallucinations that limit practical deployment. While various mitigation strategies exi…

cs.LG2026

Mitigating Cultural Bias in LLMs via Multi-Agent Cultural Debate

Qian Tan, Lei Jiang, Yuting Zeng +2

Large language models (LLMs) exhibit systematic Western-centric bias, yet whether prompting in non-Western languages (e.g., Chinese) can mitigate this remains understudied. Answeri…

cs.CL2025

GroupDebate: Enhancing the Efficiency of Multi-Agent Debate Using Group Discussion

Tongxuan Liu, Xingyu Wang, Weizhe Huang +5

In recent years, Large Language Models (LLMs) have demonstrated remarkable capabilities across diverse NLP tasks. Extensive research has explored how to enhance the logical reasoni…