7 papers
QuantumMind: Constraint-Grounded Agentic Reasoning for Speedup Analysis in Quantum Computing
Yijing Zuo, Zhe Fu, Zihan Nie +2
Identifying a meaningful quantum speedup requires more than matching a classical problem to a familiar quantum primitive: the claim must preserve the task, respect access and outpu…
MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules
Tong Xu, Xinzhe Cao, Zhihui Zhu +2
Current molecular generation benchmarks emphasize task complexity, molecule novelty, and property alignment; they largely overlook a critical concern: the potential safety risks of…
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
Mingyang Rao, Kehua Feng, Zhihui Zhu +4
While Large Language Models (LLMs) have revolutionized scientific text processing, they exhibit a significant capability gap when interpreting chemical reaction diagrams. We identi…
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
Xiang Zhuang, Chenyi Zhou, Kehua Feng +10
Artificial intelligence has demonstrated remarkable capability in predicting scientific properties, yet scientific discovery remains an inherently physical, long-horizon pursuit go…
Evaluating Reward Model Generalization via Pairwise Maximum Discrepancy Competitions
Shunyang Luo, Peibei Cao, Zhihui Zhu +3
Reward models (RMs) are central to aligning large language models, yet their practical effectiveness hinges on generalization to unseen prompts and shifting distributions. Most exi…
ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning
Yuqi Tang, Jing Yu, Zichang Su +7
Clinical diagnosis begins with doctor-patient interaction, during which physicians iteratively gather information, determine examination and refine differential diagnosis through p…