2 papers
cs.NE2026
SpikingMoE: SDPrompt-Guided Dynamic Expert Fusion in Spiking Neural Networks
Yukai Yang, Chenxi Qin, Jungang Li +3
Spiking Neural Networks (SNNs) provide an energy-efficient paradigm for visual recognition. We present SpikingMoE, which integrates a spike-driven Transformer with a Mixture-of-Exp…
cs.LG2025
Iterative GRPO: Batch-Online Multi-Turn RL via Single-Turn RLHF
Daniel R. Jiang, Ankur Samanta, Yukai Yang +3
Practical LLM agents often operate over multi-turn conversations where success is determined only after the full interaction ends. Most multi-turn RL methods train via on-policy ro…