3 papers
cs.CV2025
Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
Guoxin Wang, Jun Zhao, Xinyi Liu +8
Medical imaging provides critical evidence for clinical diagnosis, treatment planning, and surgical decisions, yet most existing imaging models are narrowly focused and require mul…
cs.SD2025
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
Fangru Zhou, Jun Zhao, Guoxin Wang
JoyTTS is an end-to-end spoken chatbot that combines large language models (LLM) with text-to-speech (TTS) technology, featuring voice cloning capabilities. This project is built u…
cs.CV2024
JoyHallo: Digital human model for Mandarin
Sheng Shi, Xuyang Cao, Jun Zhao +1
In audio-driven video generation, creating Mandarin videos presents significant challenges. Collecting comprehensive Mandarin datasets is difficult, and the complex lip movements i…