1 paper · 1 filter
Tingyu Wu, Zhisheng Chen, Ziyan Weng +8
Existing long-horizon memory benchmarks mostly use multi-turn dialogues or synthetic user histories, which makes retrieval performance an imperfect proxy for person understanding.…