4 citations · 4 across the 11 of their papers we have counts for
1 paper · 1 filter
Yu-Ang Cheng, Leyang Hu, Hai Huang +1
Autoregressive pretraining has become the de facto paradigm for learning general-purpose representations in large language models (LLMs). However, linear probe performance across d…