1 paper
Shreya Rajagopal, Jae Ho Sohn, Hari Subramonyam +1
Generative AI systems such as ChatGPT and Claude are built upon language models that are typically evaluated for accuracy on curated benchmark datasets. Such evaluation paradigms m…