1 paper
Dian Jiao, Jiaxin Duan, Shuai Zhao +3
Transformer-based large language models often suffer from inter-layer parameter redundancy, where functional transformations are redundantly learned across network depths. We propo…