1 paper
Huanyu Li, Zongyuan Li, Wei Huang +1
Large language models (LLMs) such as ChatGPT o1, ChatGPT o3, and DeepSeek R1 have shown great potential in solving difficult problems. However, current LLM evaluation benchmarks ar…