31 citations · 44 across the 52 of their papers we have counts for
6 papers · 1 filter
The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation
Arash Marioriyad, Omid Ghahroodi, Ehsaneddin Asgari +2
Large language models (LLMs) are increasingly used as automatic judges to evaluate system outputs in tasks such as reasoning, question answering, and creative writing. A faithful j…
DrugRAG: Enhancing Pharmacy LLM Performance Through A Novel Retrieval-Augmented Generation Pipeline
Houman Kazemzadeh, Kiarash Mokhtari Dizaji, Seyed Reza Tavakoli +12
In our study, we evaluated large language model (LLM) performance on pharmacy licensure-style question-answering tasks and developed an external knowledge integration method to imp…
Large Language Models for Scientific Idea Generation: A Creativity-Centered Survey
Fatemeh Shahhosseini, Arash Marioriyad, Ali Momen +3
Scientific idea generation is central to discovery, requiring the joint satisfaction of novelty and scientific soundness. Unlike standard reasoning or general creative generation,…
The Silent Judge: Unacknowledged Shortcut Bias in LLM-as-a-Judge
Arash Marioriyad, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah
Large language models (LLMs) are increasingly deployed as automatic judges to evaluate system outputs in tasks such as summarization, dialogue, and creative writing. A faithful jud…
Unspoken Hints: Accuracy Without Acknowledgement in LLM Reasoning
Arash Marioriyad, Shaygan Adim, Nima Alighardashi +2
Large language models (LLMs) increasingly rely on chain-of-thought (CoT) prompting to solve mathematical and logical reasoning tasks. Yet, a central question remains: to what exten…
Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?
Omid Ghahroodi, Marzia Nouri, Mohammad Vali Sanian +5
Evaluating Large Language Models (LLMs) is challenging due to their generative nature, necessitating precise evaluation methodologies. Additionally, non-English LLM evaluation lags…