5 papers
Data-Efficient On-Policy Distillation for Automatic Speech Recognition
Yu Lin, Yiming Wang, Runyuan Cai +1
Building competitive automatic speech recognition (ASR) models usually requires large-scale au- dio supervision, which makes reproduction and specialization expensive. We study Ark…
Factorize to Generalize: Retrieval-Guided Invariant-Dynamic Decomposition for Time Series Forecasting
Jinjin Chi, Lei Feng, Lulu Zhang +6
Time series foundation models (TSFMs) have recently achieved strong zero-shot forecasting performance through large-scale pretraining and retrieval-augmented prediction. However, o…
Zero-Shot Temporal Action Localization Through Textual Guidance
Benedetta Liberatori, Alessandro Conti, Lorenzo Vaquero +3
Zero-shot temporal action localization (ZS-TAL) consists of classifying and localizing actions in untrimmed videos, where action classes are unseen at training time. Existing work…
Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision
Runyuan Cai, Yiming Wang, Yu Lin +1
Current personalization methods for generative vision models typically encode new concepts through continuous adapters or weight updates, yet provide limited control over whether a…
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
Runyuan Cai, Yu Lin, Yiming Wang +2
Traditional speech systems typically rely on separate, task-specific models for text-to-speech (TTS), automatic speech recognition (ASR), and voice conversion (VC), resulting in fr…