image quality assessment 1interpretability 1multimodal language models 1tool-based analysis 1visual evidence reasoning 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.CV2026
HeatTok: Enhancing Remote Sensing Image Understanding via Thermodiffusion-based Tokenization
Yingying Yan, Jiaqi Tang, Wei Wei +6
Current visual tokenizers in Multimodal Large Language Models (MLLMs) predominantly rely on patch-based partitioning, which causes severe semantic mixture and object fragmentation…
cs.CV2026
Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
Jianmin Chen, Jiaqi Tang, Wei Wei +9
Multimodal large language models (MLLMs) increasingly rely on long chain-of-thought reasoning for complex tasks. However, as reasoning sequences lengthen, models may gradually rely…
cs.CV2026
IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment
Jinjian Wu, Jiaqi Tang, Wei Wei +5
The paper introduces IQA-T1, a framework that combines multimodal large language models with specialized visual analysis tools to generate explicit evidence (e.g., noise residual m…