1 paper
Tingyu Wu, Zhisheng Chen, Ziyan Weng +8
Existing long-horizon memory benchmarks mostly use multi-turn dialogues or synthetic user histories, which makes retrieval performance an imperfect proxy for person understanding.…