4 papers
Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations
Wen Luo, Guangyue Peng, Wei Li +8
Despite their impressive capabilities, large language models (LLMs) frequently generate hallucinations. Previous work shows that their internal states encode rich signals of truthf…
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
Haoran Ye, Jing Jin, Yuhang Xie +2
The advancement of large language models (LLMs) has outpaced traditional evaluation methodologies. This progress presents novel challenges, such as measuring human-like psychologic…
ArtMentor: AI-Assisted Evaluation of Artworks to Explore Multimodal Large Language Models Capabilities
Chanjin Zheng, Zengyi Yu, Yilin Jiang +4
Can Multimodal Large Language Models (MLLMs), with capabilities in perception, recognition, understanding, and reasoning, function as independent assistants in art evaluation dialo…
CiteCheck: Towards Accurate Citation Faithfulness Detection
Ziyao Xu, Shaohang Wei, Zhuoheng Han +6
Citation faithfulness detection is critical for enhancing retrieval-augmented generation (RAG) systems, yet large-scale Chinese datasets for this task are scarce. Existing methods…