3 papers
cs.LG2026
Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization
Xinchen Han, Hossam Afifi, Michel Marot +2
Large Language Models (LLMs) often generate unnecessarily verbose Chain-of-Thought (CoT) reasoning that increases computational costs and latency without proportional performance g…
cs.LG2026
PIQL: Projective Implicit Q-Learning with Support Constraint for Offline Reinforcement Learning
Xinchen Han, Hossam Afifi, Michel Marot
Offline Reinforcement Learning (RL) faces a fundamental challenge of extrapolation errors caused by out-of-distribution (OOD) actions. Implicit Q-Learning (IQL) employs expectile r…
cs.LG2026
Automatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement Learning
Xinchen Han, Qiuyang Fang, Hossam Afifi +1
Offline Reinforcement Learning (RL) relies on policy constraints to mitigate extrapolation error, where both the constraint form and constraint strength critically shape performanc…