4 papers
AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach
Zixuan Jiang, Binghao Qiang, Jiaying Chi +3
The paper introduces AgenticASR, an architecture that continuously refines speech recognition output to remove disfluencies and preserve speaker intent during live audio streams.
MMAE: A Massive Multitask Audio Editing Benchmark
Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35
We introduce MMAE, a Massive Multitask Audio Editing benchmark, serving as the first comprehensive evaluation testbed designed for general-purpose instruction-based audio editing.…
Hierarchical Multi-Label Contrastive Learning for Protein-Protein Interaction Prediction Across Organisms
Shiyi Liu, Buwen Liang, Yuetong Fang +2
Recent advances in AI for science have highlighted the power of contrastive learning in bridging heterogeneous biological data modalities. Building on this paradigm, we propose HIP…
AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization
Zixuan Jiang, Renjing Xu
Deciphering protein function remains a fundamental challenge in protein representation learning. The task presents significant difficulties for protein language models (PLMs) due t…