collaborators

8 papers

cs.AI2026

Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction

Yujia Tong, Yuxi Wang, Yunyang Wan +3

Model compression techniques such as quantization and pruning are widely used to reduce the deployment cost of large language models (LLMs), with existing evaluations focusing almo…

cs.LG2026

Forget by Uncertainty: Orthogonal Entropy Unlearning for Quantized Neural Networks

Tian Zhang, Yujia Tong, Junhao Dong +3

The deployment of quantized neural networks on edge devices, combined with privacy regulations like GDPR, creates an urgent need for machine unlearning in quantized models. However…

cs.LG2026

SAU: Sparsity-Aware Unlearning for LLMs via Gradient Masking and Importance Redistribution

Yuze Wang, Yujia Tong, Xuan Liu +1

Large Language Models (LLMs) inevitably memorize sensitive information during training, posing significant privacy risks. Machine unlearning has emerged as a promising solution to…

cs.CV2026

SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding

Yujia Tong, Tian Zhang, Yunyang Wan +3

Speculative decoding has emerged as a promising approach to accelerate inference in vision-language models (VLMs) by enabling parallel verification of multiple draft tokens. Howeve…

cs.CV2025

LetheViT: Selective Machine Unlearning for Vision Transformers via Attention-Guided Contrastive Learning

Yujia Tong, Tian Zhang, Jingling Yuan +2

Vision Transformers (ViTs) have revolutionized computer vision tasks with their exceptional performance. However, the introduction of privacy regulations such as GDPR and CCPA has…

cs.CV2025

DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning

Yujia Tong, Jingling Yuan, Tian Zhang +2

Data-Free Quantization (DFQ) enables the quantization of Vision Transformers (ViTs) without requiring access to data, allowing for the deployment of ViTs on devices with limited re…