collaborators

8 papers

cs.CL2026

Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO

Hongcheng Wang, Yinuo Huang, Sukai Wang +2

Group Relative Policy Optimization (GRPO) trains Chain-of-Thought reasoning with verifiable rewards, but estimating thought-level advantages without value functions often suffers f…

cs.LG2026

Product Interaction: An Algebraic Formalism for Deep Learning Architectures

Haonan Dong, Chun-Wun Cheng, Angelica I. Aviles-Rivero

In this paper, we introduce product interactions, an algebraic formalism in which neural network layers are constructed from compositions of a multiplication operator defined over…

cs.AI2025

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

Hang Xu, Zang Yu, Yehui Tang +3

This paper introduces MCTS-EP, an online learning framework that combines large language models (LLM) with Monte Carlo Tree Search (MCTS) for training embodied agents. MCTS-EP inte…

cs.RO2025

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

Yuzheng Gao, Yuxing Long, Lei Kang +8

Existing appliance assets suffer from poor rendering, incomplete mechanisms, and misalignment with manuals, leading to simulation-reality gaps that hinder appliance manipulation de…

cs.SD2025

SAGE-Music: Low-Latency Symbolic Music Generation via Attribute-Specialized Key-Value Head Sharing

Jiaye Tan, Haonan Luo, Linfeng Song +10

Low-latency symbolic music generation is essential for real-time improvisation and human-AI co-creation. Existing transformer-based models, however, face a trade-off between infere…

cs.RO2025

Fidelity-Aware Data Composition for Robust Robot Generalization

Zizhao Tong, Di Chen, Sicheng Hu +6

Generalist robot policies trained on large-scale, visually homogeneous datasets can be susceptible to shortcut learning, which impairs their out-of-distribution (OOD) generalizatio…