3 papers
cs.CL2025
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
Haibin Chen, Kangtao Lv, Chengwei Hu +8
With the increasing use of Large Language Models (LLMs) in fields such as e-commerce, domain-specific concept evaluation benchmarks are crucial for assessing their domain capabilit…
cs.LG2025
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
Yanshi Li, Shaopan Xiong, Gengru Chen +6
Reinforcement Learning (RL) has proven highly effective in aligning Large Language Models (LLMs) with human preferences. Typical RL methods optimize under an overall sequence rewar…
cs.AI2025
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
Yingshui Tan, Yilei Jiang, Yanshi Li +6
Fine-tuning large language models (LLMs) based on human preferences, commonly achieved through reinforcement learning from human feedback (RLHF), has been effective in improving th…