papers

Publications (74)

eess.AS2021

Glow-WaveGAN: Learning Speech Representations from GAN-based Variational Auto-Encoder For High Fidelity Flow-based Speech Synthesis

Jian Cong, Shan Yang, Lei Xie +1

cs.CV2023

Local-to-Global Panorama Inpainting for Locale-Aware Indoor Lighting Prediction

Jiayang Bai, Zhen He, Shan Yang +4

cs.SD2026

TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

Xiaoda Yang, Majun Zhang, Changhao Pan +10

cs.CV2022

Deep Graph Learning for Spatially-Varying Indoor Lighting Prediction

Jiayang Bai, Jie Guo, Chenchen Wan +6

cs.SD2026

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

Tianxin Xie, Wentao Lei, Kai Jiang +27

cs.CL2021

Entity Concept-enhanced Few-shot Relation Extraction

Shan Yang, Yongfei Zhang, Guanglin Niu +2

cs.CV2016

Detailed Garment Recovery from a Single-View Image

Shan Yang, Tanya Ambert, Zherong Pan +4

cs.CV2021

Optical Mouse: 3D Mouse Pose From Single-View Video

Bo Hu, Bryan Seybold, Shan Yang +4

cs.MA2026

Descent-Guided Policy Gradient for Scalable Cooperative Multi-Agent Learning

Shan Yang, Yang Liu

eess.AS2025

FleSpeech: Flexibly Controllable Speech Generation with Various Prompts

Hanzhao Li, Yuke Li, Xinsheng Wang +4

eess.AS2020

Data Efficient Voice Cloning from Noisy Samples with Domain Adversarial Training

Jian Cong, Shan Yang, Lei Xie +2

cs.SD2026

Covo-Audio Technical Report

Wenfu Wang, Chenxing Li, Liqiang Zhang +23

cs.SD2025

DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions

Weidong Chen, Shan Yang, Guangzhi Li +1

eess.SY2026

Agentic Application in Power Grid Static Analysis: Automatic Code Generation and Error Correction

Qinjuan Wang, Shan Yang, Yongli Zhu

cs.SD2022

Learning Noise-independent Speech Representation for High-quality Voice Conversion for Noisy Target Speakers

Liumeng Xue, Shan Yang, Na Hu +2

cs.SD2025

UniSep: Universal Target Audio Separation with Language Models at Scale

Yuanyuan Wang, Hangting Chen, Dongchao Yang +7

cs.CV2023

MeSa: Masked, Geometric, and Supervised Pre-training for Monocular Depth Estimation

Muhammad Osama Khan, Junbang Liang, Chun-Kai Wang +2

cs.CV2023

RoSI: Recovering 3D Shape Interiors from Few Articulation Images

Akshay Gadi Patil, Yiming Qian, Shan Yang +3

eess.SY2024

Edge Computing for Microgrid via MATLAB Embedded Coder and Low-Cost Smart Meters

Linna Xu, Jian Huang, Shan Yang +1

cs.SD2020

Adversarial Feature Learning and Unsupervised Clustering based Speech Synthesis for Found Data with Acoustic and Textual Noise

Shan Yang, Yuxuan Wang, Lei Xie

eess.IV2023

Aligning Multi-Sequence CMR Towards Fully Automated Myocardial Pathology Segmentation

Wangbin Ding, Lei Li, Junyi Qiu +5

eess.IV2025

TotalSegmentator MRI: Robust Sequence-independent Segmentation of Multiple Anatomic Structures in MRI

Tugba Akinci D'Antonoli, Lucas K. Berger, Ashraya K. Indrakanti +16

eess.AS2026

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

Haitao Li, Tian Tan, Yuguang Yang +2

cs.CV2024

ViLA: Efficient Video-Language Alignment for Video Question Answering

Xijun Wang, Junbang Liang, Chun-Kai Wang +4

cs.CR2021

A Color Image Steganography Based on Frequency Sub-band Selection

Hai Su, Shan Yang, Shuqing Zhang +1

cs.SD2026

MMAE: A Massive Multitask Audio Editing Benchmark

Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35

cs.CV2023

ICAR: Image-based Complementary Auto Reasoning

Xijun Wang, Anqi Liang, Junbang Liang +3

cs.SD2020

Learn2Sing: Target Speaker Singing Voice Synthesis by learning from a Singing Teacher

Heyang Xue, Shan Yang, Yi Lei +2

eess.AS2021

Controllable Context-aware Conversational Speech Synthesis

Jian Cong, Shan Yang, Na Hu +3

cond-mat.mtrl-sci2021

Observation of a Novel Lattice Instability in Ultrafast Photoexcited SnSe

Yijing Huang, Shan Yang, Samuel Teitelbaum +11

eess.AS2026

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

Guanrou Yang, Tian Tan, Qian Chen +12

eess.SP2025

Movable Antennas-Assisted Over-the-Air Computation: Dynamic and Static Design

Zhenqiao Cheng, Nanxi Li, Jianchi Zhu +3

cs.SD2020

Accent and Speaker Disentanglement in Many-to-many Voice Conversion

Zhichao Wang, Wenshuo Ge, Xiong Wang +6

eess.IV2023

TotalSegmentator: robust segmentation of 104 anatomical structures in CT images

Jakob Wasserthal, Hanns-Christian Breit, Manfred T. Meyer +9

cs.CV2024

EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization

Zhendong Xiao, Changhao Chen, Shan Yang +1

cs.MM2025

Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning

Le Xu, Chenxing Li, Yong Ren +5

cs.CV2024

Multi-centric AI Model for Unruptured Intracranial Aneurysm Detection and Volumetric Segmentation in 3D TOF-MRI

Ashraya K. Indrakanti, Jakob Wasserthal, Martin Segeroth +6

cs.CL2026

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Shan Yang

eess.AS2026

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

Guanrou Yang, Tian Tan, Qian Chen +8

cs.SD2025

EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering

Tianxin Xie, Shan Yang, Chenxing Li +2

cs.SD2025

Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation

Yan Rong, Shan Yang, Chenxing Li +2

cs.CV2024

MFTF: Mask-free Training-free Object Level Layout Control Diffusion Model

Shan Yang

cs.SD2022

UniSyn: An End-to-End Unified Model for Text-to-Speech and Singing Voice Synthesis

Yi Lei, Shan Yang, Xinsheng Wang +4

eess.IV2025

Contrast-Free Myocardial Scar Segmentation in Cine MRI using Motion and Texture Fusion

Guang Yang, Jingkun Chen, Xicheng Sheng +5

cs.CV2022

Attention Bottlenecks for Multimodal Fusion

Arsha Nagrani, Shan Yang, Anurag Arnab +3

cs.CV2016

Modeling Context in Referring Expressions

Licheng Yu, Patrick Poirson, Shan Yang +2

cs.SD2020

Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training

Haohan Guo, Heng Lu, Na Hu +5

cs.SD2022

MsEmoTTS: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis

Yi Lei, Shan Yang, Xinsheng Wang +1

cs.SD2020

Fine-grained Emotion Strength Transfer, Control and Prediction for Emotional Speech Synthesis

Yi Lei, Shan Yang, Lei Xie

eess.SY2024

Distributed Stochastic ACOPF Based on Consensus ADMM and Scenario Reduction

Shan Yang, Yongli Zhu

cs.CV2025

MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization

Zhendong Xiao, Wu Wei, Shujie Ji +2

cs.SD2025

AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation

Yan Rong, Jinting Wang, Guangzhi Lei +2

cs.CV2025

Cued-Agent: A Collaborative Multi-Agent System for Automatic Cued Speech Recognition

Guanjie Huang, Danny H. K. Tsang, Shan Yang +2

eess.AS2021

Referee: Towards reference-free cross-speaker style transfer with low-quality data for expressive speech synthesis

Songxiang Liu, Shan Yang, Dan Su +1

cs.SD2020

Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech

Geng Yang, Shan Yang, Kai Liu +3

cs.LG2026

Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning

Peihao Wang, Shan Yang, Xijun Wang +8

cs.CV2021

AI Choreographer: Music Conditioned 3D Dance Generation with AIST++

Ruilong Li, Shan Yang, David A. Ross +1

cs.CV2025

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

Jinting Wang, Shan Yang, Chenxing Li +2

eess.AS2022

VCVTS: Multi-speaker Video-to-Speech synthesis via cross-modal knowledge transfer from voice conversion

Disong Wang, Shan Yang, Dan Su +3

cs.CV2024

MLLMReID: Multimodal Large Language Model-based Person Re-identification

Shan Yang, Yongfei Zhang

cond-mat.str-el2024

Ultrafast lattice disordering can be accelerated by electronic collisional forces

Gilberto A. de la Pena Munoz, Alfredo A. Correa, Shan Yang +11

cs.SD2020

Controllable Emotion Transfer For End-to-End Speech Synthesis

Tao Li, Shan Yang, Liumeng Xue +1

cs.AI2025

Offline Reinforcement Learning for Microgrid Voltage Regulation

Shan Yang, Yongli Zhu

eess.AS2020

Exploiting Deep Sentential Context for Expressive End-to-End Speech Synthesis

Fengyu Yang, Shan Yang, Qinghua Wu +2

cs.SD2024

TokSing: Singing Voice Synthesis based on Discrete Tokens

Yuning Wu, Chunlei zhang, Jiatong Shi +3

cs.SD2017

Statistical Parametric Speech Synthesis Using Generative Adversarial Networks Under A Multi-task Learning Framework

Shan Yang, Lei Xie, Xiao Chen +4

cs.MA2026

Mean-Field Reinforcement Learning without Synchrony

Shan Yang

cs.MM2025

Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model

Yong Ren, Chenxing Li, Le Xu +7

cs.IR2024

Unleashing the Power of Large Language Models in Zero-shot Relation Extraction via Self-Prompting

Siyi Liu, Yang Li, Jiang Li +2

cs.SD2023

A High Fidelity and Low Complexity Neural Audio Coding

Wenzhe Liu, Wei Xiao, Meng Wang +6

cond-mat.mtrl-sci2023

Determination of nonthermal bonding origin of a novel photoexcited lattice instability in SnSe

Yijing Huang, Samuel Teitelbaum, Shan Yang +10

cs.SD2022

Glow-WaveGAN 2: High-quality Zero-shot Text-to-speech Synthesis and Any-to-any Voice Conversion

Yi Lei, Shan Yang, Jian Cong +2

eess.IV2022

MyoPS-Net: Myocardial Pathology Segmentation with Flexible Combination of Multi-Sequence CMR Images

Junyi Qiu, Lei Li, Sihan Wang +4

eess.AS2022

End-to-End Voice Conversion with Information Perturbation

Qicong Xie, Shan Yang, Yi Lei +2