8 papers
SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification
Feixiang Liu, Likun Wang, Qiang Qiu +3
Spatial relation questions require a model to identify the queried subject and object before comparing their layout. Yet a VLM can recognize both entities and still answer from the…
Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers
Fexiang Liu, Shiye Wang, Qiang Qiu +1
The paper introduces Witness Evidence Portfolios (WEP), a method that analyzes the internal visual contributions of multimodal large language models to detect risky closed-form vis…
Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference
Feixiang Liu, Qiang Qiu, Hao Zhang +1
Visual-token pruning is usually judged by answer quality at a fixed retention budget. For text-rich multimodal large language models (MLLMs), this protocol can miss a distinct fail…
Visual Credit Audit for Multimodal Spatial Reasoning
Feixiang Liu, Qiang Qiu, Lanbo Sun +3
The paper introduces Visual Credit Audit (VCA), a method to quantify how much an image actually contributes to a multimodal model’s answer on spatial reasoning tasks, separating co…
Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification
Jeeyung Kim, Erfan Esmaeili, Qiang Qiu
The paper introduces Class-Contrastive Influence (C2I) to evaluate how useful diffusion‑generated images are for few‑shot medical classification, and uses reinforcement learning to…
From Classification to Ranking: Enhancing LLM Reasoning Capabilities for MBTI Personality Detection
Yuan Cao, Feixiang Liu, Xinyue Wang +4
Personality detection aims to measure an individual's corresponding personality traits through their social media posts. The advancements in Large Language Models (LLMs) offer nove…