activity
20242026
collaborators

10 papers

cs.CL2026

CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms

Kaiyan Zhao, Zhongtao Miao, Zheyong Xie +2

Chinese neologisms exploit diverse and unique linguistic mechanisms, such as phonetic substitution (e.g., 886 for ``bye-bye'') and visual character decomposition that are rare in o…

cs.CL2026

RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa +1

Data mixture selection is critical for Large Language Model pretraining. Existing methods such as RegMix select a single static mixture by fitting a regression model on small-scale…

cs.CL2026

GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression

Zhongtao Miao, Qiyu Wu, Yoshimasa Tsuruoka

Text embedding and generative tasks are usually trained separately based on large language models (LLMs) nowadays. This causes a large amount of training cost and deployment effort…

cs.CL2026

Benchmarking Machine Translation on Chinese Social Media Texts

Kaiyan Zhao, Zheyong Xie, Zhongtao Miao +3

The prevalence of rapidly evolving slang, neologisms, and highly stylized expressions in informal user-generated text, particularly on Chinese social media, poses significant chall…

cs.CL2026

NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning

Zhongtao Miao, Kaiyan Zhao, Masaaki Nagata +1

Neologism-aware machine translation aims to translate source sentences containing neologisms into target languages. This field remains underexplored compared with general machine t…

cs.CL2025

Improving Multimodal Contrastive Learning of Sentence Embeddings with Object-Phrase Alignment

Kaiyan Zhao, Zhongtao Miao, Yoshimasa Tsuruoka

Multimodal sentence embedding models typically leverage image-caption pairs in addition to textual data during training. However, such pairs often contain noise, including redundan…