Publications (74)
Glow-WaveGAN: Learning Speech Representations from GAN-based Variational Auto-Encoder For High Fidelity Flow-based Speech Synthesis
Jian Cong, Shan Yang, Lei Xie +1
Local-to-Global Panorama Inpainting for Locale-Aware Indoor Lighting Prediction
Jiayang Bai, Zhen He, Shan Yang +4
TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation
Xiaoda Yang, Majun Zhang, Changhao Pan +10
Deep Graph Learning for Spatially-Varying Indoor Lighting Prediction
Jiayang Bai, Jie Guo, Chenchen Wan +6
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
Tianxin Xie, Wentao Lei, Kai Jiang +27
Entity Concept-enhanced Few-shot Relation Extraction
Shan Yang, Yongfei Zhang, Guanglin Niu +2
Detailed Garment Recovery from a Single-View Image
Shan Yang, Tanya Ambert, Zherong Pan +4
Optical Mouse: 3D Mouse Pose From Single-View Video
Bo Hu, Bryan Seybold, Shan Yang +4
Descent-Guided Policy Gradient for Scalable Cooperative Multi-Agent Learning
Shan Yang, Yang Liu
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
Hanzhao Li, Yuke Li, Xinsheng Wang +4
Data Efficient Voice Cloning from Noisy Samples with Domain Adversarial Training
Jian Cong, Shan Yang, Lei Xie +2
Covo-Audio Technical Report
Wenfu Wang, Chenxing Li, Liqiang Zhang +23
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
Weidong Chen, Shan Yang, Guangzhi Li +1
Agentic Application in Power Grid Static Analysis: Automatic Code Generation and Error Correction
Qinjuan Wang, Shan Yang, Yongli Zhu
Learning Noise-independent Speech Representation for High-quality Voice Conversion for Noisy Target Speakers
Liumeng Xue, Shan Yang, Na Hu +2
UniSep: Universal Target Audio Separation with Language Models at Scale
Yuanyuan Wang, Hangting Chen, Dongchao Yang +7
MeSa: Masked, Geometric, and Supervised Pre-training for Monocular Depth Estimation
Muhammad Osama Khan, Junbang Liang, Chun-Kai Wang +2
RoSI: Recovering 3D Shape Interiors from Few Articulation Images
Akshay Gadi Patil, Yiming Qian, Shan Yang +3
Edge Computing for Microgrid via MATLAB Embedded Coder and Low-Cost Smart Meters
Linna Xu, Jian Huang, Shan Yang +1
Adversarial Feature Learning and Unsupervised Clustering based Speech Synthesis for Found Data with Acoustic and Textual Noise
Shan Yang, Yuxuan Wang, Lei Xie
Aligning Multi-Sequence CMR Towards Fully Automated Myocardial Pathology Segmentation
Wangbin Ding, Lei Li, Junyi Qiu +5
TotalSegmentator MRI: Robust Sequence-independent Segmentation of Multiple Anatomic Structures in MRI
Tugba Akinci D'Antonoli, Lucas K. Berger, Ashraya K. Indrakanti +16
AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following
Haitao Li, Tian Tan, Yuguang Yang +2
ViLA: Efficient Video-Language Alignment for Video Question Answering
Xijun Wang, Junbang Liang, Chun-Kai Wang +4
A Color Image Steganography Based on Frequency Sub-band Selection
Hai Su, Shan Yang, Shuqing Zhang +1
MMAE: A Massive Multitask Audio Editing Benchmark
Ziyang Ma, Ruiqi Yan, Ruiyang Xu +35
ICAR: Image-based Complementary Auto Reasoning
Xijun Wang, Anqi Liang, Junbang Liang +3
Learn2Sing: Target Speaker Singing Voice Synthesis by learning from a Singing Teacher
Heyang Xue, Shan Yang, Yi Lei +2
Controllable Context-aware Conversational Speech Synthesis
Jian Cong, Shan Yang, Na Hu +3
Observation of a Novel Lattice Instability in Ultrafast Photoexcited SnSe
Yijing Huang, Shan Yang, Samuel Teitelbaum +11
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
Guanrou Yang, Tian Tan, Qian Chen +12
Movable Antennas-Assisted Over-the-Air Computation: Dynamic and Static Design
Zhenqiao Cheng, Nanxi Li, Jianchi Zhu +3
Accent and Speaker Disentanglement in Many-to-many Voice Conversion
Zhichao Wang, Wenshuo Ge, Xiong Wang +6
TotalSegmentator: robust segmentation of 104 anatomical structures in CT images
Jakob Wasserthal, Hanns-Christian Breit, Manfred T. Meyer +9
EffLoc: Lightweight Vision Transformer for Efficient 6-DOF Camera Relocalization
Zhendong Xiao, Changhao Chen, Shan Yang +1
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
Le Xu, Chenxing Li, Yong Ren +5
Multi-centric AI Model for Unruptured Intracranial Aneurysm Detection and Volumetric Segmentation in 3D TOF-MRI
Ashraya K. Indrakanti, Jakob Wasserthal, Martin Segeroth +6
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
Shan Yang
GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
Guanrou Yang, Tian Tan, Qian Chen +8
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
Tianxin Xie, Shan Yang, Chenxing Li +2
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
Yan Rong, Shan Yang, Chenxing Li +2
MFTF: Mask-free Training-free Object Level Layout Control Diffusion Model
Shan Yang
UniSyn: An End-to-End Unified Model for Text-to-Speech and Singing Voice Synthesis
Yi Lei, Shan Yang, Xinsheng Wang +4
Contrast-Free Myocardial Scar Segmentation in Cine MRI using Motion and Texture Fusion
Guang Yang, Jingkun Chen, Xicheng Sheng +5
Attention Bottlenecks for Multimodal Fusion
Arsha Nagrani, Shan Yang, Anurag Arnab +3
Modeling Context in Referring Expressions
Licheng Yu, Patrick Poirson, Shan Yang +2
Phonetic Posteriorgrams based Many-to-Many Singing Voice Conversion via Adversarial Training
Haohan Guo, Heng Lu, Na Hu +5
MsEmoTTS: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis
Yi Lei, Shan Yang, Xinsheng Wang +1
Fine-grained Emotion Strength Transfer, Control and Prediction for Emotional Speech Synthesis
Yi Lei, Shan Yang, Lei Xie
Distributed Stochastic ACOPF Based on Consensus ADMM and Scenario Reduction
Shan Yang, Yongli Zhu
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
Zhendong Xiao, Wu Wei, Shujie Ji +2
AudioGenie: A Training-Free Multi-Agent Framework for Diverse Multimodality-to-Multiaudio Generation
Yan Rong, Jinting Wang, Guangzhi Lei +2
Cued-Agent: A Collaborative Multi-Agent System for Automatic Cued Speech Recognition
Guanjie Huang, Danny H. K. Tsang, Shan Yang +2
Referee: Towards reference-free cross-speaker style transfer with low-quality data for expressive speech synthesis
Songxiang Liu, Shan Yang, Dan Su +1
Multi-band MelGAN: Faster Waveform Generation for High-Quality Text-to-Speech
Geng Yang, Shan Yang, Kai Liu +3
Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning
Peihao Wang, Shan Yang, Xijun Wang +8
AI Choreographer: Music Conditioned 3D Dance Generation with AIST++
Ruilong Li, Shan Yang, David A. Ross +1
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
Jinting Wang, Shan Yang, Chenxing Li +2
VCVTS: Multi-speaker Video-to-Speech synthesis via cross-modal knowledge transfer from voice conversion
Disong Wang, Shan Yang, Dan Su +3
MLLMReID: Multimodal Large Language Model-based Person Re-identification
Shan Yang, Yongfei Zhang
Ultrafast lattice disordering can be accelerated by electronic collisional forces
Gilberto A. de la Pena Munoz, Alfredo A. Correa, Shan Yang +11
Controllable Emotion Transfer For End-to-End Speech Synthesis
Tao Li, Shan Yang, Liumeng Xue +1
Offline Reinforcement Learning for Microgrid Voltage Regulation
Shan Yang, Yongli Zhu
Exploiting Deep Sentential Context for Expressive End-to-End Speech Synthesis
Fengyu Yang, Shan Yang, Qinghua Wu +2
TokSing: Singing Voice Synthesis based on Discrete Tokens
Yuning Wu, Chunlei zhang, Jiatong Shi +3
Statistical Parametric Speech Synthesis Using Generative Adversarial Networks Under A Multi-task Learning Framework
Shan Yang, Lei Xie, Xiao Chen +4
Mean-Field Reinforcement Learning without Synchrony
Shan Yang
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
Yong Ren, Chenxing Li, Le Xu +7
Unleashing the Power of Large Language Models in Zero-shot Relation Extraction via Self-Prompting
Siyi Liu, Yang Li, Jiang Li +2
A High Fidelity and Low Complexity Neural Audio Coding
Wenzhe Liu, Wei Xiao, Meng Wang +6
Determination of nonthermal bonding origin of a novel photoexcited lattice instability in SnSe
Yijing Huang, Samuel Teitelbaum, Shan Yang +10
Glow-WaveGAN 2: High-quality Zero-shot Text-to-speech Synthesis and Any-to-any Voice Conversion
Yi Lei, Shan Yang, Jian Cong +2
MyoPS-Net: Myocardial Pathology Segmentation with Flexible Combination of Multi-Sequence CMR Images
Junyi Qiu, Lei Li, Sihan Wang +4
End-to-End Voice Conversion with Information Perturbation
Qicong Xie, Shan Yang, Yi Lei +2