1 paper
Isak Hwang, Yoon Pyo Lee, Syed Bahauddin Alam
Competence claims for a language model in a safety-critical domain are credible when measured against a standard the domain already enforces. We evaluate an open-weight 31-billion-…