2 papers
cs.DC2026
Why Smaller Is Slower? Dimensional Misalignment in Compressed LLMs
Jihao Xin, Tian Lyu, Qilong Pan +2
Post-training compression reduces LLM parameter counts but often produces irregular tensor dimensions that degrade GPU performance -- a phenomenon we call \emph{dimensional misalig…
cs.LG2025
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
Keyu Wang, Tian Lyu, Guinan Su +4
Layer pruning has emerged as a widely adopted technique for improving the efficiency of large language models (LLMs). Although existing methods demonstrate strong performance reten…