collaborators

5 papers

cs.AI2026

Data-Efficient On-Policy Distillation for Automatic Speech Recognition

Yu Lin, Yiming Wang, Runyuan Cai +1

Building competitive automatic speech recognition (ASR) models usually requires large-scale au- dio supervision, which makes reproduction and specialization expensive. We study Ark…

cs.LG2026

Factorize to Generalize: Retrieval-Guided Invariant-Dynamic Decomposition for Time Series Forecasting

Jinjin Chi, Lei Feng, Lulu Zhang +6

Time series foundation models (TSFMs) have recently achieved strong zero-shot forecasting performance through large-scale pretraining and retrieval-augmented prediction. However, o…

cs.CV2026

Zero-Shot Temporal Action Localization Through Textual Guidance

Benedetta Liberatori, Alessandro Conti, Lorenzo Vaquero +3

Zero-shot temporal action localization (ZS-TAL) consists of classifying and localizing actions in untrimmed videos, where action classes are unseen at training time. Existing work…

cs.CV2026

Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision

Runyuan Cai, Yiming Wang, Yu Lin +1

Current personalization methods for generative vision models typically encode new concepts through continuous adapters or weight updates, yet provide limited control over whether a…

cs.SD2026

Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers

Runyuan Cai, Yu Lin, Yiming Wang +2

Traditional speech systems typically rely on separate, task-specific models for text-to-speech (TTS), automatic speech recognition (ASR), and voice conversion (VC), resulting in fr…