1 paper
Ruishan Guo, Yibing Liu, Guoxin Ma +6
Scaling up model parameters has long been a prevalent training paradigm driven by the assumption that larger models yield superior generation capabilities. However, under lossy con…