1 paper · 1 filter
Xuran Li, Guanqin Zhang, Imran Razzak +4
Current evaluation paradigms for Large Language Model (LLM) personalization rely heavily on brittle surface-matching metrics or computationally expensive LLM-as-a-judge protocols,…