collaborators

8 papers

cs.CL2026

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

Xiaocheng Lu, Hualei Zhang, Shuhan Guo +8

Diffusion language models (dLLMs) can predict many tokens in parallel, but accurate generation still requires many iterative denoising steps. Few-step distillation accelerates deco…

cs.AI2026

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

Xuanzhi Feng, Zhengyang Li, Zeyu Liu +6

Reinforcement Learning with Verifiable Rewards (RLVR) has significantly advanced Large Language Model (LLM) reasoning; however, it faces a fundamental optimization instability: uni…

cs.AI2026

READER: Dynamic LLM Provenance from Query-Varying Interactions

Jiaxu Liu, Sunnan Mu, Dong Huang +3

Existing black-box LLM provenance methods achieve comparability by querying every candidate model with the same diagnostic prompts. In deployment, auditors inherit a different evid…

cs.LG2026

Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations

Zeyu Liu, Xuanzhi Feng, Sing Kwong Lai +6

The financial market is a typical low signal-to-noise ratio (SNR) setting, which often destabilizes off-policy maximum-entropy methods like Soft Actor-Critic (SAC). Specifically, n…

cs.CV2026

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

Xiaocheng Lu, Yuxi Chen, Jie Zhang +5

Image tokenizers, from 2D grids to recent 1D sequences, typically encode every image with the same fixed number of tokens. Yet visual complexity is highly heterogeneous, so a unifo…

cs.LG2026

DiffoR: A Unified Continuous Generative Framework for Universal Ordinal Regression

Hongxu Ma, Lin Wang, Chenghou Jin +6

Ordinal Regression (OR) aims to predict target values with inherent order, underpinning critical applications across diverse domains, from recommender systems to computer vision. T…