2 papers
cs.CE2026
MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning
Wenjin Liu, Haoran Luo, Fayuan Ke +5
Recently, multimodal large language models (MLLMs) have demonstrated strong potential in visual understanding and complex reasoning tasks. However, existing methods often struggle…
cs.CV2025
Fully Spiking Neural Networks for Unified Frame-Event Object Tracking
Jingjun Yang, Liangwei Fan, Jinpu Zhang +3
The integration of image and event streams offers a promising approach for achieving robust visual object tracking in complex environments. However, current fusion methods achieve…