Showing cs.AIShow all
2 papers · 1 filter
cs.AI2025
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
Huanqia Cai, Yijun Yang, Winston Hu
IQ testing has served as a foundational methodology for evaluating human cognitive capabilities, deliberately decoupling assessment from linguistic background, language proficiency…
cs.AI2024
System-2 Mathematical Reasoning via Enriched Instruction Tuning
Huanqia Cai, Yijun Yang, Zhifeng Li
Solving complex mathematical problems via system-2 reasoning is a natural human skill, yet it remains a significant challenge for current large language models (LLMs). We identify…