1 paper
Wenjie Wang, Yue Huang, Zipeng Ling +11
Large language models (LLMs) are increasingly deployed as UX judges that inspect interfaces, diagnose usability problems, and propose repairs. Yet no controlled benchmark measures…