1 paper
Insung Lee, Taeyoung Jeong, Haejun Yoo +2
While Large Audio-Language Models (LALMs) have advanced audio captioning, robust evaluation remains difficult. Reference-based metrics are expensive and often fail to assess acoust…