2 papers
cs.CL2025
Thinking Augmented Pre-training
Liang Wang, Nan Yang, Shaohan Huang +2
This paper introduces a simple and scalable approach to improve the data efficiency of large language model (LLM) training by augmenting existing text data with thinking trajectori…
cs.CV2025
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
Haonan Chen, Liang Wang, Nan Yang +4
Multimodal embedding models have gained significant attention for their ability to map data from different modalities, such as text and images, into a unified representation space.…