activity
20182025
most citedToward Large-scale Spiking Neural Networks: A Comprehensive Survey and Future Directions

3 citations · 9 across the 14 of their papers we have counts for

collaborators

18 papers

cs.LG2025

Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization

Juntao Dai, Taiye Chen, Yaodong Yang +2

Reinforcement learning from human feedback (RLHF) is an effective method for aligning large language models (LLMs) with human values. However, reward over-optimization remains an o…

cs.SE2024

Darkit: A User-Friendly Software Toolkit for Spiking Large Language Model

Xin Du, Shifan Ye, Qian Zheng +7

Large language models (LLMs) have been widely applied in various practical applications, typically comprising billions of parameters, with inference processes requiring substantial…

cs.LG2024

Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation

Juntao Dai, Yaodong Yang, Qian Zheng +1

A key aspect of Safe Reinforcement Learning (Safe RL) involves estimating the constraint condition for the next policy, which is crucial for guiding the optimization of safe policy…

cs.HC2024★ 1 cited

Copiloting Diagnosis of Autism in Real Clinical Scenarios via LLMs

Yi Jiang, Qingyang Shen, Shuzhong Lai +5

Autism spectrum disorder(ASD) is a pervasive developmental disorder that significantly impacts the daily functioning and social participation of individuals. Despite the abundance…

cs.LG2024★ 3 cited

Toward Large-scale Spiking Neural Networks: A Comprehensive Survey and Future Directions

Yangfan Hu, Qian Zheng, Guoqi Li +2

Deep learning has revolutionized artificial intelligence (AI), achieving remarkable progress in fields such as computer vision, speech recognition, and natural language processing.…

cs.LG2024

Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline

Wenjia Meng, Qian Zheng, Long Yang +2

Policy-based methods have achieved remarkable success in solving challenging reinforcement learning problems. Among these methods, off-policy policy gradient methods are particular…