1 paper · 1 filter
Yiyang Li, Zheyuan Zhang, Tianyi Ma +4
We introduce LongDA, a data analysis benchmark for evaluating LLM-based agents under documentation-intensive analytical workflows. In contrast to existing benchmarks that assume we…