1 paper
Sanghyeok Park, Minji Kang, Hosung Kwak +1
Modern LLMs demonstrate impressive multilingual performance, yet standard benchmarks primarily reward selecting correct answers rather than evaluating genuine factual understanding…