agent evaluation 1benchmark transfer 1dynamic claim-level evaluation 1expert-grounded assessment 1open-ended professional tasks 1
From the 1 of 5 linked papers with an AI index.
Showing cs.AIShow all
3 papers · 1 filter
cs.AI2026
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
Lanbo Lin, Jiayao Liu, Tianyuan Yang +5
JADE is a two‑layer evaluation system that encodes expert knowledge as predefined evaluation skills and adds claim‑level, evidence‑gated assessment to more reliably evaluate AI age…
cs.AI2026
FadeMem: Biologically-Inspired Forgetting for Efficient Agent Memory
Lei Wei, Xiao Peng, Xu Dong +2
Large language models deployed as autonomous agents face critical memory limitations, lacking selective forgetting mechanisms that lead to either catastrophic forgetting at context…
cs.AI2026
Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning
Lei Wei, Xiao Peng, Jinpeng Ou +1
Large language models (LLMs) have demonstrated remarkable capabilities in function calling for autonomous agents, yet current mechanisms lack explicit reasoning transparency during…