2 papers
cs.CL2026
Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models
Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng +1
Multilingual large language models (LLMs) depend on subword tokenization to bridge discrete text and continuous neural representation. State-of-the-art multilingual LLMs often use…
cs.CL2026
Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency
Andrew Ivan Soegeng, Patrick Sutanto, Tan Sang Nguyen
Although Large Language Models (LLMs) demonstrate strong capabilities across various tasks, they exhibit significant performance discrepancies across languages. While prompting LLM…