Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
J. Ben Tamo, Yuxing Lu, Benoit L. Marteau +2
Large Language Models (LLMs) are fluent but prone to hallucinations, producing answers that appear plausible yet are unsupported by available evidence. This failure is especially p…
cs.CL2025
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
Yuxing Lu, Xukai Zhao, J. Ben Tamo +6
Large Language Models (LLMs) have demonstrated remarkable capabilities on general text; however, their proficiency in specialized scientific domains that require deep, interconnect…