agent evaluation 1benchmark transfer 1dynamic claim-level evaluation 1expert-grounded assessment 1open-ended professional tasks 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.AI2026
JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks
Lanbo Lin, Jiayao Liu, Tianyuan Yang +5
JADE is a two‑layer evaluation system that encodes expert knowledge as predefined evaluation skills and adds claim‑level, evidence‑gated assessment to more reliably evaluate AI age…
cs.CV2025
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
Zhiwei Jin, Xiaohui Song, Nan Wang +36
In recent years, while cloud-based MLLMs such as QwenVL, InternVL, GPT-4o, Gemini, and Claude Sonnet have demonstrated outstanding performance with enormous model sizes reaching hu…
cs.AI2024
AlignLLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation
Hongzhe Huang, Jiang Liu, Zhewen Yu +8
Recent advances in Multi-modal Large Language Models (MLLMs), such as LLaVA-series models, are driven by massive machine-generated instruction-following data tuning. Such automatic…