3 papers
cs.LG2025
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
Tao Ren, Jinyang Jiang, Hui Yang +10
Reinforcement learning with verifiable reward has recently emerged as a central paradigm for post-training large language models (LLMs); however, prevailing mean-based methods, suc…
cond-mat.mtrl-sci2025
Field-free superconducting diode effect of NbSe2 induced by strain
Jiajun Li, Minhao Zou, Fengyi Guo +12
Superconducting diodes, similar to semiconductor diodes, possess unidirectional superconducting properties and are the fundamental units for constructing superconducting quantum co…
cs.CL2024
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
Jiajie Zhang, Yushi Bai, Xin Lv +8
Though current long-context large language models (LLMs) have demonstrated impressive capacities in answering user questions based on extensive text, the lack of citations in their…