2 papers
cs.IR2025
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
Jianlyu Chen, Nan Wang, Chaofan Li +6
Evaluation plays a crucial role in the advancement of information retrieval (IR) models. However, current benchmarks, which are based on predefined domains and human-labeled data,…
cs.CL2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON
Feng Wang, Zesheng Shi, Bo Wang +2
We present ReaderLM-v2, a compact 1.5 billion parameter language model designed for efficient web content extraction. Our model processes documents up to 512K tokens, transforming…