1 paper · 1 filter
Wei Tao, Bin Zhang, Xiaoyang Qu +2
Recently, large language models (LLMs) have been able to handle longer and longer contexts. However, a context that is too long may cause intolerant inference latency and GPU memor…