3 papers
cs.CL2026
JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction
Zhaolu Kang, Yantao Liu, Tailong Luo +14
Criminal judgment prediction requires models to infer statutory articles, charges, and sentencing outcomes from case facts. Unlike standard classification tasks, it involves a stru…
cs.CL2026
Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning
Zhaolu Kang, Meixin Wu, Yu Xue +6
Omni-modal large language models are increasingly evaluated on clean text--vision--audio inputs, where every channel is present, synchronized, and readily interpretable. Such score…
cs.AI2026
EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff
Xiao Ma, Zhiquan Hu, Yi Wei +5
Reinforcement learning enables Agentic RAG systems to learn multi-turn search from verifiable outcome rewards, but all- zero rollout groups provide no comparative signal and may hi…