1 paper · 1 filter
Daniel Agyei Asante, Yang Li
Long-context compression is essential for reducing the cost and latency of large language model inference. However, existing methods can fragment important evidence, require additi…