2 papers
cs.CV2026
HeatTok: Enhancing Remote Sensing Image Understanding via Thermodiffusion-based Tokenization
Yingying Yan, Jiaqi Tang, Wei Wei +6
Current visual tokenizers in Multimodal Large Language Models (MLLMs) predominantly rely on patch-based partitioning, which causes severe semantic mixture and object fragmentation…
cs.CV2026
Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning
Jianmin Chen, Jiaqi Tang, Wei Wei +9
Multimodal large language models (MLLMs) increasingly rely on long chain-of-thought reasoning for complex tasks. However, as reasoning sequences lengthen, models may gradually rely…