1 paper
Rongjin Li, Weibin Zhang, Dongpeng Chen +2
In conventional deep speaker embedding frameworks, the pooling layer aggregates all frame-level features over time and computes their mean and standard deviation statistics as inpu…