1 paper
Radha Gulhane, Sathish Reddy Indurthi
Aligning multimodal large language models (MLLMs) with human preferences often relies on single-signal, model-based reward methods. Such monolithic rewards often lack confidence ca…