1 paper
Haoming Jing, Oren Wright, José M. F. Moura +1
Sequential fine-tuning of transformers is useful when new data arrive sequentially, especially with shifting distributions. Unlike batch learning, sequential learning demands that…