1 paper · 1 filter
Juyuan Wang, Chenxing Wang, Yuchen Fang +8
Decoding-free reranking methods that read relevance signals directly from LLM attention weights offer significant latency advantages over autoregressive approaches, yet suffer from…