collaborators

5 papers

cs.LG2026

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

Hao Wang, Kun Yuan, Wenlin Zhong +4

Open-weight language models from different families exhibit complementary capabilities, motivating their consolidation into a compact student through on-policy distillation (OPD).…

cs.CL2026

PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

Yuting Huang, Yinghao Hu, Qian Xiao +7

Large language models (LLMs) have achieved remarkable success in general-domain tasks, yet their direct application to the legal domain remains challenging due to hallucinated lega…

cs.CL2026

SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent

Wenlin Zhong, Jinluan Yang, Yiquan Wu +3

Reinforcement Learning (RL) has empowered Large Language Models (LLMs) to master autonomous search for complex question answering. However, particularly within multi-turn search sc…

cs.CL2026

P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering

Wenlin Zhong, Chengyuan Liu, Yiquan Wu +5

While reinforcement learning with verifiable rewards (RLVR) has advanced LLM reasoning in structured domains like mathematics and programming, its application to general-domain rea…

cs.CL2025

Universal Legal Article Prediction via Tight Collaboration between Supervised Classification Model and LLM

Xiao Chi, Wenlin Zhong, Yiquan Wu +4

Legal Article Prediction (LAP) is a critical task in legal text classification, leveraging natural language processing (NLP) techniques to automatically predict relevant legal arti…