1 paper
Joesph An, Joseph An, Phillip Keung +3
Audio language models process input audio into rich frame-level representations, but the standard approach to temporal localization generates timestamps as sequences of text tokens…