1 paper
Lovish Madaan, Srinadh Bhojanapalli, Himanshu Jain +1
Standard inference and training with transformer based architectures scale quadratically with input sequence length. This is prohibitively large for a variety of applications espec…