2 papers
cs.AI2026
VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference
Wenxu Jia, Dongjie Fu, Xize Cheng +6
Recent advancements in Speech Large Language Models have demonstrated remarkable capabilities in understanding complex audio tasks. Despite this progress, their long-context infere…
cs.LG2026
X-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
Dongjie Fu, Di Cao, Xize Cheng +6
While large audio-language models have achieved remarkable progress in auditory perception, they still lag behind text-based large language models in deep logical reasoning, primar…