Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies
Wei Jiang, Wei Wang
Vision-Language-Action (VLA) models process long multimodal token sequences, making inference expensive in both memory and computation. Existing efficiency methods mainly reduce vi…
cs.LG2026
Sub-Token Routing for KV Cache Compression
Wei Jiang, Wei Wang
Transformer inference often requires a large KV cache, especially for long-context language modeling and multimodal generation. Existing compression methods usually reduce cache co…