agent evaluation 1benchmark transfer 1dynamic claim-level evaluation 1expert-grounded assessment 1open-ended professional tasks 1
From the 1 of 3 linked papers with an AI index.
Showing cs.AIShow all
2 papers · 1 filter
cs.AI2026
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
Lanbo Lin, Jiayao Liu, Tianyuan Yang +5
JADE is a two‑layer evaluation system that encodes expert knowledge as predefined evaluation skills and adds claim‑level, evidence‑gated assessment to more reliably evaluate AI age…
cs.AI2024
AlignLLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation
Hongzhe Huang, Jiang Liu, Zhewen Yu +8
Recent advances in Multi-modal Large Language Models (MLLMs), such as LLaVA-series models, are driven by massive machine-generated instruction-following data tuning. Such automatic…