2 papers
cs.LG2026
ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment
Xiuyu Li, Jinkai Zhang, Mingyang Yi +4
Reinforcement Learning (RL) post-training alignment for language models is effective, but also costly and unstable in practice, owing to its complicated training process. To addres…
cs.CL2025
SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking
Yuanchun Wang, Jifan Yu, Zijun Yao +13
Applying large language models (LLMs) for academic API usage shows promise in reducing researchers' academic information seeking efforts. However, current LLM API-using methods str…