4 papers · 1 filter
Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models
Siqi Luo, Jianghan Shen, Yi Xin +9
Diffusion Multi-Modal Large Language Models (dMLLMs) are powerful for image generation, but optimizing them through reinforcement learning (RL) remains a major challenge. One prima…
An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing
Lianrui Zuo, Yihao Liu, Gaurav Rudravaram +15
Medical imaging research is increasingly shifting from controlled benchmark evaluation toward real-world clinical deployment. In such settings, applying analytical methods extends…
VisualDeltas: Learning Preferences from Visual Quality Perturbations
Hailiang Huang, Yihao Liu, Shengyue Guan +2
We present VisualDeltas, a lightweight preference-learning framework that extracts supervision from visual quality variations in multimodal data. By leveraging the systematic impac…
From Screens to Scenes: A Survey of Embodied AI in Healthcare
Yihao Liu, Xu Cao, Tingting Chen +7
Healthcare systems worldwide face persistent challenges in efficiency, accessibility, and personalization. Powered by modern AI technologies such as multimodal large language model…