3 papers
cs.CL2026
-Prediction Flow: Efficient Continuous Decoding for Masked Diffusion Language Models
Weitian Wang, Lianlei Shan, Shubham Rai +2
Masked diffusion language models (MDLMs) generate text by iteratively unmasking tokens, but their standard decoder reduces each step to a binary action: a position is either commit…
cs.CV2025
HTTM: Head-wise Temporal Token Merging for Faster VGGT
Weitian Wang, Lukas Meiner, Rai Shubham +2
The Visual Geometry Grounded Transformer (VGGT) marks a significant leap forward in 3D scene reconstruction, as it is the first model that directly infers all key 3D attributes (ca…
cs.CV2025
MixA-Q: Revisiting Activation Sparsity for Vision Transformers from a Mixed-Precision Quantization Perspective
Weitian Wang, Rai Shubham, Cecilia De La Parra +1
In this paper, we propose MixA-Q, a mixed-precision activation quantization framework that leverages intra-layer activation sparsity (a concept widely explored in activation prunin…