4 papers
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
Tingjia Miao, Wenkai Jin, Muhua Zhang +19
The paradigm of agentic science requires AI systems to conduct robust reasoning and engage in long-horizon, autonomous exploration. However, current scientific benchmarks remain co…
PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research
Tingjia Miao, Wenkai Jin, Jinxin Tan +22
Advances in LLM reasoning and tool use have enabled agentic science, yet frontier theoretical and computational physics remains challenging because research requires deep domain ex…
LLMartini: Seamless and Interactive Leveraging of Multiple LLMs through Comparison and Composition
Yingtian Shi, Jinda Yang, Yuhan Wang +4
The growing diversity of large language models (LLMs) means users often need to compare and combine outputs from different models to obtain higher-quality or more comprehensive res…
G-VOILA: Gaze-Facilitated Information Querying in Daily Scenarios
Zeyu Wang, Yuanchun Shi, Yuntao Wang +6
Modern information querying systems are progressively incorporating multimodal inputs like vision and audio. However, the integration of gaze -- a modality deeply linked to user in…