1 paper
Seungcheol Park, Sojin Lee, Jongjin Kim +3
How can we accelerate large language models(LLMs) without sacrificing accuracy? The slow inference speed of LLMs hinders us to benefit from their remarkable performance in diverse…