8 papers
Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction
Yujia Tong, Yuxi Wang, Yunyang Wan +3
Model compression techniques such as quantization and pruning are widely used to reduce the deployment cost of large language models (LLMs), with existing evaluations focusing almo…
Forget by Uncertainty: Orthogonal Entropy Unlearning for Quantized Neural Networks
Tian Zhang, Yujia Tong, Junhao Dong +3
The deployment of quantized neural networks on edge devices, combined with privacy regulations like GDPR, creates an urgent need for machine unlearning in quantized models. However…
SAU: Sparsity-Aware Unlearning for LLMs via Gradient Masking and Importance Redistribution
Yuze Wang, Yujia Tong, Xuan Liu +1
Large Language Models (LLMs) inevitably memorize sensitive information during training, posing significant privacy risks. Machine unlearning has emerged as a promising solution to…
SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding
Yujia Tong, Tian Zhang, Yunyang Wan +3
Speculative decoding has emerged as a promising approach to accelerate inference in vision-language models (VLMs) by enabling parallel verification of multiple draft tokens. Howeve…
LetheViT: Selective Machine Unlearning for Vision Transformers via Attention-Guided Contrastive Learning
Yujia Tong, Tian Zhang, Jingling Yuan +2
Vision Transformers (ViTs) have revolutionized computer vision tasks with their exceptional performance. However, the introduction of privacy regulations such as GDPR and CCPA has…
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
Yujia Tong, Jingling Yuan, Tian Zhang +2
Data-Free Quantization (DFQ) enables the quantization of Vision Transformers (ViTs) without requiring access to data, allowing for the deployment of ViTs on devices with limited re…