Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
Tue Le, Linh Ngo Van, Trung Le
Reinforcement learning with verifiable rewards (RLVR) has become a practical route to improve large language model reasoning, and Group Relative Policy Optimization (GRPO) is a wid…
cs.LG2025
Few-shot Continual Relation Extraction via Open Information Extraction
Thiem Nguyen, Anh Nguyen, Quyen Tran +4
Typically, Few-shot Continual Relation Extraction (FCRE) models must balance retaining prior knowledge while adapting to new tasks with extremely limited data. However, real-world…