Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR
Tommy Sha, Skylar Zhai, Siqi Zhao
In reinforcement learning with verifiable rewards (RLVR) trained with group relative policy optimization (GRPO), the KL-free reward-advantage term studied here depends on within-gr…
cs.LG2025
FAST-CAD: A Fairness-Aware Framework for Non-Contact Stroke Diagnosis
Tommy Sha, Zhan Cheng, Haotian Zhai +9
Stroke is an acute cerebrovascular disease, and timely diagnosis significantly improves patient survival. However, existing automated diagnosis methods suffer from fairness issues…