1 paper · 1 filter
Daphne Quillington, Kingsley Fairbrother, Xavier Tattershall +1
Optimization methodologies for training large-scale neural architectures often rely on uniform gradient propagation mechanisms that fail to align with hierarchical linguistic struc…