190 citations
- Fudan UniversityCN81 papers
- State Key Laboratory of Surface Physics47 papers
- Tsinghua UniversityCN46 papers
- Collaborative Innovation Center of Advanced MicrostructuresCN22 papers
- Hefei UniversityCN20 papers
- Shanghai Artificial Intelligence LaboratoryCN14 papers
- University of Shanghai for Science and TechnologyCN14 papers
- Shanghai Jiao Tong UniversityCN9 papers
- Beijing Academy of Artificial IntelligenceCN8 papers
- East China Normal UniversityCN8 papers
- Shanghai Fudan Microelectronics (China)CN8 papers
- Shanghai Research Center for Quantum SciencesCN8 papers
4 papers · 1 filter
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
Chen Liang, Zhaoqi Huang, Haofen Wang +8
Large language models (LLMs), as a novel information technology, are seeing increasing adoption in the Architecture, Engineering, and Construction (AEC) field. They have shown thei…
CritiQ: Mining Data Quality Criteria from Human Preferences
Honglin Guo, Kai Lv, Qipeng Guo +8
Language model heavily depends on high-quality data for optimal performance. Existing approaches rely on manually designed heuristics, the perplexity of existing models, training c…
Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations
Jiaxing Sun, Weiquan Huang, Jiang Wu +5
We introduce CHARM, the first benchmark for comprehensively and in-depth evaluating the commonsense reasoning ability of large language models (LLMs) in Chinese, which covers both…
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
Ge Bai, Jie Liu, Xingyuan Bu +8
The advent of Large Language Models (LLMs) has drastically enhanced dialogue systems. However, comprehensively evaluating the dialogue abilities of LLMs remains a challenge. Previo…