3 papers
cs.LG2026
From Belief Entrenchment to Robust Reasoning in LLM Agents
Jihwan Oh, Minchan Jeong, Jongwoo Ko +1
Multi-Agent Debate (MAD) has emerged as a promising inference scaling method for Large Language Model (LLM) reasoning. However, it frequently suffers from belief entrenchment, wher…
cs.CL2025
Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
Jongwoo Ko, Sungnyun Kim, Sungwoo Cho +1
Human-generated reward signals are critical for aligning generative models with human preferences, guiding both training and inference-time evaluations. While large language models…
cs.AI2025
Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness
Yongjin Yang, Euiin Yi, Jongwoo Ko +3
The remarkable growth in large language model (LLM) capabilities has spurred exploration into multi-agent systems, with debate frameworks emerging as a promising avenue for enhance…