1 paper · 1 filter
Yiran Luo, Het Patel, Yu Fu +4
Recent research has shown that pruning large-scale language models for inference is an effective approach to improving model efficiency, significantly reducing model weights with m…