activity
20232026
most citedSafeguarding Large Language Models: A Survey

8 citations · 8 across the 7 of their papers we have counts for

collaborators
Showing cs.LGShow all

6 papers · 1 filter

cs.LG2025

POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization

Xinyu Li, Tianjin Huang, Ronghui Mu +2

Recent advances in Chain-of-Thought (CoT) prompting have substantially enhanced the reasoning capabilities of large language models (LLMs), enabling sophisticated problem-solving t…

cs.LG2025

Principal Eigenvalue Regularization for Improved Worst-Class Certified Robustness of Smoothed Classifiers

Gaojie Jin, Tianjin Huang, Ronghui Mu +1

Recent studies have identified a critical challenge in deep neural networks (DNNs) known as ``robust fairness", where models exhibit significant disparities in robust accuracy acro…

cs.LG2025

Enhancing Robust Fairness via Confusional Spectral Regularization

Gaojie Jin, Sihao Wu, Jiaxu Liu +2

Recent research has highlighted a critical issue known as ``robust fairness", where robust accuracy varies significantly across different classes, undermining the reliability of de…

cs.LG2024

Invariant Correlation of Representation with Label: Enhancing Domain Generalization in Noisy Environments

Gaojie Jin, Ronghui Mu, Xinping Yi +2

The Invariant Risk Minimization (IRM) approach aims to address the challenge of domain generalization by training a feature representation that remains invariant across multiple en…

cs.LG2023

Reward Certification for Policy Smoothed Reinforcement Learning

Ronghui Mu, Leandro Soriano Marcolino, Tianle Zhang +3

Reinforcement Learning (RL) has achieved remarkable success in safety-critical areas, but it can be weakened by adversarial attacks. Recent studies have introduced "smoothed polici…

cs.LG20232 cited

Randomized Adversarial Training via Taylor Expansion

Gaojie Jin, Xinping Yi, Dengyu Wu +2

In recent years, there has been an explosion of research into developing more robust deep neural networks against adversarial examples. Adversarial training appears as one of the m…