3 papers
cs.CL2026
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
Lucky Susanto, Musa Izzanardi Wijanarko, Khumaisa Nur'aini +3
While pixel-based language modeling aims to bypass the sub-word tokenization bottleneck by rendering text as images, recent multimodal variants such as DualGPT reintroduce text tok…
cs.CL2026
Beyond Transfer Accuracy: Mechanism-Guided Controlled Adaptation for Low-Resource Languages
Khumaisa Nur'aini, Ayu Purwarianti, Alham Fikri Aji +1
Existing circuit discovery methods rely on templated tasks with clean counterfactuals, limiting their use on diverse natural text. We adapt Contextual Decomposition for Transformer…
cs.CL2025
NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts
Muhammad Farid Adilazuarda, Musa Izzanardi Wijanarko, Lucky Susanto +3
Indonesia is rich in languages and scripts. However, most NLP progress has been made using romanized text. In this paper, we present NusaAksara, a novel public benchmark for Indone…