18 papers
VCNAC: A Variable-Channel Neural Audio Codec for Mono, Stereo, and Surround Sound
Florian Grötschla, Arunasish Sen, Alessandro Lombardi +2
We present VCNAC, a variable channel neural audio codec. Our approach features a single encoder and decoder parametrization that enables native inference for different channel setu…
Benchmarking Positional Encodings for GNNs and Graph Transformers
Florian Grötschla, Jiaqing Xie, Roger Wattenhofer
Positional Encodings (PEs) are essential for injecting structural information into Graph Neural Networks (GNNs), particularly Graph Transformers, yet their empirical impact remains…
Evaluating Objective Speech Quality Metrics for Neural Audio Codecs
Luca A. Lanzendörfer, Florian Grötschla
Neural audio codecs have gained recent popularity for their use in generative modeling as they offer high-fidelity audio reconstruction at low bitrates. While human listening studi…
Inductive Transfer Learning for Graph-Based Recommenders
Florian Grötschla, Elia Trachsel, Luca A. Lanzendörfer +1
Graph-based recommender systems are commonly trained in transductive settings, which limits their applicability to new users, items, or datasets. We propose NBF-Rec, a graph-based…
SAO-Instruct: Free-form Audio Editing using Natural Language Instructions
Michael Ungersböck, Florian Grötschla, Luca A. Lanzendörfer +3
Generative models have made significant progress in synthesizing high-fidelity audio from short textual descriptions. However, editing existing audio using natural language has rem…
EuroSpeech: A Multilingual Speech Corpus
Samuel Pfisterer, Florian Grötschla, Luca A. Lanzendörfer +2
Recent progress in speech processing has highlighted that high-quality performance across languages requires substantial training data for each individual language. While existing…