1 paper
Chuyifei Zhang, Hongyu Cui, Xiaowen Huang +1
Position-controlled evaluation is standard for retrieval tasks such as Needle-in-a-Haystack and RULER, but mainstream reasoning benchmarks do not control positional placement of ta…