2 papers
cs.AI2026
S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF
Wei Chen, Guanghui Zhu, Yafei Li +2
Reinforcement learning from human feedback (RLHF) with preference-based reward models often exhibits unstable training dynamics. A key contributing factor is that standard RLHF rel…
cs.AI2024
ChatGraph: Chat with Your Graphs
Yun Peng, Sen Lin, Qian Chen +4
Graph analysis is fundamental in real-world applications. Traditional approaches rely on SPARQL-like languages or clicking-and-dragging interfaces to interact with graph data. Howe…