2 papers
cs.AI2026
VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference
Wenxu Jia, Dongjie Fu, Xize Cheng +6
Recent advancements in Speech Large Language Models have demonstrated remarkable capabilities in understanding complex audio tasks. Despite this progress, their long-context infere…
cs.LG2026
Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning
Dongjie Fu, Fangming Feng, Xize Cheng +3
The rapid evolution of multimodal large models has revolutionized the simulation of diverse characters in speech dialogue systems, enabling a novel interactive paradigm. Character…