3 papers
cs.CV2026
MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
Xiangxiang Cui, Tianjin Huang, Yifang Wang +2
Medical foundation models have achieved remarkable clinical performance, yet their robustness under real-world perturbations remains underexplored. We present a robustness benchmar…
cs.LG2025
Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models
Liangyu Wang, Huanyi Xie, Xinhai Wang +3
Group-based reinforcement learning algorithms such as Group Reward Policy Optimization (GRPO) have proven effective for fine-tuning large language models (LLMs) with human feedback…
cs.CL2025
The Compositional Architecture of Regret in Large Language Models
Xiangxiang Cui, Shu Yang, Tianjin Huang +3
Regret in Large Language Models refers to their explicit regret expression when presented with evidence contradicting their previously generated misinformation. Studying the regret…