2 papers
cs.DC2026
APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing
Hong Guo, Nianhui Guo, Weixing Wang +3
W4A4 quantization promises full utilization of INT4 Tensor Cores, yet group dequantization overhead on CUDA Cores has driven existing systems to mixed-precision fallbacks. We prese…
cs.CV2026
Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models
Weixing Wang, Liudvikas Zekas, Anton Hackl +5
Unified Multimodal Models (uMMs) aim to support both visual understanding and visual generation within a shared representation. However, existing evaluation protocols assess these…