Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making
M3 Team, Chengfeng Dou, Fan Yang +15
We introduce Baichuan-M3, a medical-enhanced large language model engineered to shift the paradigm from passive question-answering to active, clinical-grade decision support. Addre…
cs.CL2025
DCPO: Dynamic Clipping Policy Optimization
Shihui Yang, Chengfeng Dou, Peidong Guo +4
Reinforcement Learning from Verifiable Rewards (RLVR) has emerged as a promising framework for enhancing the reasoning capabilities of large language models. However, existing appr…