Showing 2025 · cs.AIShow all
2 papers · 2 filters
cs.AI2025
PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data
Kai Xiong, Yanwei Huang, Rongjunchen Zhang +3
High-quality mathematical and logical datasets with verifiable answers are essential for strengthening the reasoning capabilities of large language models (LLMs). While recent data…
cs.AI2025
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
Guilong Lu, Xuntao Guo, Rongjunchen Zhang +2
Large language models excel in general tasks, yet assessing their reliability in logic-heavy, precision-critical domains like finance, law, and healthcare remains challenging. To a…