1 paper
Hong Chen, Kang Chen, Yuxuan Fan +4
Stateful multimodal assistants encode an image once but may answer questions about it many turns later. Attention-guided visual-KV eviction assumes that evidence irrelevant now wil…