collaborators

5 papers

cs.SD2026

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

Shibo Wang, Zicheng Zhang, Libo Wang +1

LLM-based full-duplex voice services allow users to speak while the assistant is responding. Because servers can generate output and advance dialogue state faster than clients can…

cs.CL2026

UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities

Qi Jia, Haodong Zhao, Dun Pei +7

Benchmarking large language models (LLMs) and agents in multi-turn interactive scenarios is essential for understanding their practical capabilities. However, existing evaluation p…

cs.AI2026

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

Hengjian Gao, Kaiwei Zhang, Shibo Wang +8

The rapid progress of Multimodal Large Language Models (MLLMs) marks a significant step toward artificial general intelligence, offering great potential for augmenting human capabi…

cs.MM2025

MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion

Junbo Wang, Yan Zhao, Shuo Li +3

Micro-expressions (MEs) are crucial leakages of concealed emotion, yet their study has been constrained by a reliance on silent, visual-only data. To solve this issue, we introduce…

cs.LG2025

A Study on Regularization-Based Continual Learning Methods for Indic ASR

Gokul Adethya T, S. Jaya Nirmala

Indias linguistic diversity poses significant challenges for developing inclusive Automatic Speech Recognition (ASR) systems. Traditional multilingual models, which require simulta…