2 papers
cs.NE2026
SpikingMoE: SDPrompt-Guided Dynamic Expert Fusion in Spiking Neural Networks
Yukai Yang, Chenxi Qin, Jungang Li +3
Spiking Neural Networks (SNNs) provide an energy-efficient paradigm for visual recognition. We present SpikingMoE, which integrates a spike-driven Transformer with a Mixture-of-Exp…
cs.CV2026
Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models
Linghao Zhang, Jungang Li, Yonghua Hei +12
Multimodal large language models (MLLMs) are typically trained in multiple stages, with video-based supervised fine-tuning (Video-SFT) serving as a key step for improving visual un…