collaborators

12 papers

cs.CV2026

DocClaw: A Unified Agentic System for Intelligent Document Processing

Siqi Xiang, Zhipeng Xu, Yufei Liu +6

Intelligent document processing (IDP) encompasses a broad range of tasks, including optical character recognition (OCR), document question answering (DocQA), and key information ex…

cs.SD2026

Audio Interaction Model

Zhifei Xie, Zihang Liu, Ze An +8

Audio is continuous and interactive, yet most Large Audio Language Models (LALMs) remain offline and streaming systems usually specialize in ASR or spoken dialogue. We formalize th…

cs.CL2026

When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

Khoi Le, Tri Cao, Phong Nguyen +5

Weak-to-strong (W2S) generalization is a promising framework for scalable oversight, yet existing evaluations often test students under matched train-test distributions. Therefore,…

cs.LG2026

WeCon: An Efficient Weight-Conditioned Neural Solver for Multi-Objective Combinatorial Optimization Problems

Xuan Wu, Jinbiao Chen, Yang Li +7

Existing neural solvers for Multi-Objective Combinatorial Optimization Problems (MOCOPs) commonly adopt decomposition-based strategies that scalarize a MOCOP into multiple subprobl…

cs.SD2026

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

Zhifei Xie, Kaiyu Pang, Haobin Zhang +4

Despite rapid advances in automatic speech recognition (ASR) and large audio-language models, robust recognition in real-world environments remains limited by an "acoustic robustne…

cs.LG2026

EVA-0: Test-Time Model Evolution with Only Two Forward Passes per Sample

Guohao Chen, Shuaicheng Niu, Geng Li +4

Test-time model evolution offers a promising way for deployed models to improve from unlabeled test-time experience, yet most existing methods depend on backpropagation (BP), which…