1 paper · 1 filter
Zhuowei Chen, Xiang Lorraine Li
Post-training large language models (LLMs) without real-world interaction feedback or human-labeled supervision remains challenging, particularly in specialized domains where exper…