2 papers
cs.AI2026
RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models
San Kim, Daechul Ahn, Reokyoung Kim +3
Modern Vision-Language Models (VLMs) often struggle with strategic reasoning, i.e., anticipating and influencing other agents' actions, under uncertainty in competitive and coopera…
cs.CL2025
Becoming Experienced Judges: Selective Test-Time Learning for Evaluators
Seungyeon Jwa, Daechul Ahn, Reokyoung Kim +2
Automatic evaluation with large language models, commonly known as LLM-as-a-judge, is now standard across reasoning and alignment tasks. Despite evaluating many samples in deployme…