2 papers
eess.AS2025
OmniAudio: Generating Spatial Audio from 360-Degree Video
Huadai Liu, Tianyi Luo, Kaicheng Luo +11
Traditional video-to-audio generation techniques primarily focus on perspective video and non-spatial audio, often missing the spatial cues necessary for accurately representing so…
cs.CV2022
Bear the Query in Mind: Visual Grounding with Query-conditioned Convolution
Chonghan Chen, Qi Jiang, Chih-Hao Wang +4
Visual grounding is a task that aims to locate a target object according to a natural language expression. As a multi-modal task, feature interaction between textual and visual inp…