9 papers
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
Baorong Shi, Bo Cui, Boyuan Jiang +17
We present MedXIAOHE, a medical vision-language foundation model designed to advance general-purpose medical understanding and reasoning in real-world clinical applications. MedXIA…
EduResearchBench: A Hierarchical Atomic Task Decomposition Benchmark for Full-Lifecycle Educational Research
Houping Yue, Zixiang Di, Mei Jiang +5
While Large Language Models (LLMs) are reshaping the paradigm of AI for Social Science (AI4SS), rigorously evaluating their capabilities in scholarly writing remains a major challe…
Building Software by Rolling the Dice: A Qualitative Study of Vibe Coding
Yi-Hung Chou, Boyuan Jiang, Yi Wen Chen +4
Large language models (LLMs) are reshaping software engineering by enabling "vibe coding," in which developers build software primarily through prompts rather than writing code. Al…
Context as a Tool: Context Management for Long-Horizon SWE-Agents
Shukai Liu, Jian Yang, Bo Jiang +4
Agents based on large language models have recently shown strong potential on real-world software engineering (SWE) tasks that require long-horizon interaction with repository-scal…
SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
Mei Jiang, Houping Yue, Bingdong Li +4
Fostering students' abilities for knowledge integration and transfer in complex problem-solving scenarios is a core objective of modern education, and interdisciplinary STEM is a k…
ELMES: An Automated Framework for Evaluating Large Language Models in Educational Scenarios
Shou'ang Wei, Xinyun Wang, Shuzhen Bi +9
The emergence of Large Language Models (LLMs) presents transformative opportunities for education, generating numerous novel application scenarios. However, significant challenges…