1 paper · 1 filter
Ruishan Guo, Yibing Liu, Guoxin Ma +6
Scaling up model parameters has long been a prevalent training paradigm driven by the assumption that larger models yield superior generation capabilities. However, under lossy con…