activity
20222026
most citedAttract me to Buy: Advertisement Copywriting Generation with Multimodal Multi-structured Information

2 citations · 2 across the 11 of their papers we have counts for

collaborators

15 papers

eess.IV2026

DeVAR: Low-Dose CT Denoising via Visual Autoregressive Modeling

Xizhuo Zhang, Yannian Gu, Zhongzhen Huang +2

Computed tomography (CT) plays a crucial role in medical diagnosis, but minimizing radiation exposure while maintaining image quality remains a critical challenge. Low-dose CT (LDC…

cs.CL2026

Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent

Zhongzhen Huang, Yan Ling, Hong Chen +7

We present PULSE, a medical reasoning agent that combines a domain-tuned large language model with scientific literature retrieval to support diagnostic decision-making in complex…

cs.CL2026

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

Yannian Gu, Zhongzhen Huang, Linjie Mu +3

Multimodal large language models (MLLMs) demonstrate considerable potential in clinical diagnostics, a domain that inherently requires synthesizing complex visual and textual data…

cs.CV2026

CT-Flow: Orchestrating CT Interpretation Workflow with Model Context Protocol Servers

Yannian Gu, Xizhuo Zhang, Linjie Mu +4

Recent advances in Large Vision-Language Models (LVLMs) have shown strong potential for multi-modal radiological reasoning, particularly in tasks like diagnostic visual question an…

cs.AI2026

EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories

Linjie Mu, Zhongzhen Huang, Yannian Gu +3

World models offer a principled framework for simulating future states under interventions, but realizing such models in complex, high-stakes domains like medicine remains challeng…

cs.CV2025

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

Shengyi Hua, Jianfeng Wu, Tianle Shen +7

Recent pathological foundation models have substantially advanced visual representation learning and multimodal interaction. However, most models still rely on a static inference p…