3 citations · 9 across the 14 of their papers we have counts for
18 papers
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
Juntao Dai, Taiye Chen, Yaodong Yang +2
Reinforcement learning from human feedback (RLHF) is an effective method for aligning large language models (LLMs) with human values. However, reward over-optimization remains an o…
Darkit: A User-Friendly Software Toolkit for Spiking Large Language Model
Xin Du, Shifan Ye, Qian Zheng +7
Large language models (LLMs) have been widely applied in various practical applications, typically comprising billions of parameters, with inference processes requiring substantial…
Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation
Juntao Dai, Yaodong Yang, Qian Zheng +1
A key aspect of Safe Reinforcement Learning (Safe RL) involves estimating the constraint condition for the next policy, which is crucial for guiding the optimization of safe policy…
Copiloting Diagnosis of Autism in Real Clinical Scenarios via LLMs
Yi Jiang, Qingyang Shen, Shuzhong Lai +5
Autism spectrum disorder(ASD) is a pervasive developmental disorder that significantly impacts the daily functioning and social participation of individuals. Despite the abundance…
Toward Large-scale Spiking Neural Networks: A Comprehensive Survey and Future Directions
Yangfan Hu, Qian Zheng, Guoqi Li +2
Deep learning has revolutionized artificial intelligence (AI), achieving remarkable progress in fields such as computer vision, speech recognition, and natural language processing.…
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline
Wenjia Meng, Qian Zheng, Long Yang +2
Policy-based methods have achieved remarkable success in solving challenging reinforcement learning problems. Among these methods, off-policy policy gradient methods are particular…