2 papers
cs.DC2026
CCCL: Node-Spanning GPU Collectives with CXL Memory Pooling
Dong Xu, Han Meng, Xinyu Chen +11
Large language models (LLMs) training or inference across multiple nodes introduces significant pressure on GPU memory and interconnect bandwidth. The Compute Express Link (CXL) sh…
cs.CV2025
Efficient Vision-Language Reasoning via Adaptive Token Pruning
Xue Li, Xiaonan Song, Henry Hu
Real-world deployment of Vision-Language Models (VLMs) is hindered by high computational demands, as existing architectures inefficiently process all tokens uniformly. We introduce…