1 paper
Taylor Maxson, Roberto Corizzo, Yaning Wu +2
Class-level evaluation can conceal substantial performance disparities across subconcepts within the same class, causing models that perform well on average to fail on specific sub…