3 papers
cs.LG2026
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
Senkang Hu, Yong Dai, Xudong Han +4
Long-horizon LLM agents depend on intermediate information-gathering turns, yet training feedback is usually observed only at the final answer, because process-level rewards requir…
cs.CL2026
Distribution-Aligned Decoding for Efficient LLM Task Adaptation
Senkang Hu, Xudong Han, Jinqi Jiang +5
Adapting billion-parameter language models to a downstream task is still costly, even with parameter-efficient fine-tuning (PEFT). We re-cast task adaptation as output-distribution…
cs.LG2026
DSP-Reg: Domain-Sensitive Parameter Regularization for Robust Domain Generalization
Xudong Han, Senkang Hu, Yihang Tao +4
Domain Generalization (DG) is a critical area that focuses on developing models capable of performing well on data from unseen distributions, which is essential for real-world appl…