2 papers
cs.CL2025
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
Yongyu Mu, Hengyu Li, Junxin Wang +7
Previous work on augmenting large multimodal models (LMMs) for text-to-image (T2I) generation has focused on enriching the input space of in-context learning (ICL). This includes p…
cs.CL2024
A Modular-based Strategy for Mitigating Gradient Conflicts in Simultaneous Speech Translation
Xiaoqian Liu, Yangfan Du, Jianjin Wang +5
Simultaneous Speech Translation (SimulST) involves generating target language text while continuously processing streaming speech input, presenting significant real-time challenges…