1 paper
Yichi Zhang, Fangzheng Xie, Shu Yang +1
In language tasks that require extensive human--model interaction, deploying a single "best" model for every query can be expensive. To reduce inference cost while preserving the q…