Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback
Jiaye Lin, Mengdi Li, Xufeng Zhao +4
Reward models trained through Reinforcement Learning from AI Feedback (RLAIF) methods frequently suffer from limited generalizability, which hinders the alignment performance of po…
cs.AI2024
Details Make a Difference: Object State-Sensitive Neurorobotic Task Planning
Xiaowen Sun, Xufeng Zhao, Jae Hee Lee +3
The state of an object reflects its current status or condition and is important for a robot's task planning and manipulation. However, detecting an object's state and generating a…