Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
SAFE: An LLM-as-Verifier Framework for Evidence-Grounded Multi-Hop Reasoning
Daeyong Kwon, Soyoung Yoon, Seung-won Hwang
Multi-hop QA benchmarks often reward Large Language Models (LLMs) for spurious correctness, where models reach correct answers through invalid intermediate reasoning. We propose SA…
cs.CL2025
RoToR: Towards More Reliable Responses for Order-Invariant Inputs
Soyoung Yoon, Dongha Ahn, Youngwon Lee +3
Mitigating positional bias of language models (LMs) for listwise inputs is a well-known and important problem (e.g., lost-in-the-middle). While zero-shot order-invariant LMs have b…