From the 1 of 5 linked papers with an AI index.
5 papers
CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection
Qiyang Sun, Yi Chang, Yupei Li +3
The paper introduces CHARM, a training-free framework that calibrates large language model predictions and fuses prosodic acoustic cues to improve zero-shot multimodal sarcasm dete…
SIGMA: Saliency-Guided Sparse Mask Attacks for Speech Emotion Recognition
Qiyang Sun, Yi Chang, Zixing Zhang +1
Speech conveys rich emotional information. As Speech Emotion Recognition (SER) is usually deployed in privacy-sensitive and reliability-critical environments, adversarial attacks o…
Cross-Dialect Bird Species Recognition with Dialect-Calibrated Augmentation
Jiani Ding, Qiyang Sun, Alican Akman +1
Dialect variation hampers automatic recognition of bird calls collected by passive acoustic monitoring. We address the problem on DB3V, a three-region, ten-species corpus of 8-s cl…
Audio-based Kinship Verification Using Age Domain Conversion
Qiyang Sun, Alican Akman, Xin Jing +2
Audio-based kinship verification (AKV) is important in many domains, such as home security monitoring, forensic identification, and social network analysis. A key challenge in the…
Audio Explanation Synthesis with Generative Foundation Models
Alican Akman, Qiyang Sun, Björn W. Schuller
The increasing success of audio foundation models across various tasks has led to a growing need for improved interpretability to understand their intricate decision-making process…