agent evaluation 1benchmark transfer 1dynamic claim-level evaluation 1expert-grounded assessment 1open-ended professional tasks 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.AI2026
Business Arena: Benchmarking LLM Agents in a Realistic Marketplace
Yijun Pan, Yukun Lian, Kunyu Shi +5
Running a business is a challenging form of intelligent work. Operators must infer opportunities from partial signals, commit capital under uncertainty, adapt to delayed outcomes i…
cs.AI2026
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
Lanbo Lin, Jiayao Liu, Tianyuan Yang +5
JADE is a two‑layer evaluation system that encodes expert knowledge as predefined evaluation skills and adds claim‑level, evidence‑gated assessment to more reliably evaluate AI age…
cs.CL2025
Put Teacher in Student's Shoes: Cross-Distillation for Ultra-compact Model Compression Framework
Maolin Wang, Jun Chu, Sicong Xie +4
In the era of mobile computing, deploying efficient Natural Language Processing (NLP) models in resource-restricted edge settings presents significant challenges, particularly in e…