1 paper · 1 filter
Yang Xu, Jiefu Zhang, Haixiang Sun +3
Adaptive prompt and program search makes LLM evaluation selection-sensitive. Once benchmark items are reused inside tuning, the observed winner's score need not estimate the fresh-…