3 papers
cs.CV2025
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models
Xiaochuan Lin, Xiangyong Chen, Xuan Li +1
Despite remarkable advancements, current Text-to-Image (T2I) models struggle with complex, long-form textual instructions, frequently failing to accurately render intricate details…
cs.CL2024
Reasoning-Aware Query-Focused Summarization over Multi-Table Data
Xiaochuan Lin, Xiangyong Chen
Query-focused summarization over multi-table data is a challenging yet critical task for extracting precise and relevant information from structured data. Existing methods often re…
cs.CV2024
Improving Visual Storytelling with Multimodal Large Language Models
Xiaochuan Lin, Xiangyong Chen
Visual storytelling is an emerging field that combines images and narratives to create engaging and contextually rich stories. Despite its potential, generating coherent and emotio…