10 papers
CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms
Kaiyan Zhao, Zhongtao Miao, Zheyong Xie +2
Chinese neologisms exploit diverse and unique linguistic mechanisms, such as phonetic substitution (e.g., 886 for ``bye-bye'') and visual character decomposition that are rare in o…
RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories
Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa +1
Data mixture selection is critical for Large Language Model pretraining. Existing methods such as RegMix select a single static mixture by fitting a regression model on small-scale…
GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression
Zhongtao Miao, Qiyu Wu, Yoshimasa Tsuruoka
Text embedding and generative tasks are usually trained separately based on large language models (LLMs) nowadays. This causes a large amount of training cost and deployment effort…
Benchmarking Machine Translation on Chinese Social Media Texts
Kaiyan Zhao, Zheyong Xie, Zhongtao Miao +3
The prevalence of rapidly evolving slang, neologisms, and highly stylized expressions in informal user-generated text, particularly on Chinese social media, poses significant chall…
NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
Zhongtao Miao, Kaiyan Zhao, Masaaki Nagata +1
Neologism-aware machine translation aims to translate source sentences containing neologisms into target languages. This field remains underexplored compared with general machine t…
Improving Multimodal Contrastive Learning of Sentence Embeddings with Object-Phrase Alignment
Kaiyan Zhao, Zhongtao Miao, Yoshimasa Tsuruoka
Multimodal sentence embedding models typically leverage image-caption pairs in addition to textual data during training. However, such pairs often contain noise, including redundan…