1 paper · 1 filter
Yuran Wang, Zekun Wang, Bohan Zeng +10
Large language model training in open-ended domains lacks verifiable rewards, making task preferences difficult to formalize as effective supervision. Contexts can convey such pref…