From the 1 of 6 linked papers with an AI index.
1 paper · 1 filter
Jan Betley, Johannes Treutlein, Jan DubiÅski +7
The paper identifies and measures covert value leakage, where large language models let their own values subtly bias answers without informing users, and introduces evaluation suit…