2 papers
cs.CR2026
Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning
Zhongan Bi, Qiwen Wang, Jianrong Jiang +11
Search-augmented LLM agents are increasingly used for consumer decisions, making them vulnerable to Generative Engine Optimization (GEO) poisoning. Existing benchmarks largely meas…
cs.AI2026
UI-Venus-2 Technical Report
Venus Team, Zhuohan Cai, Haoxing Chen +28
Multimodal GUI agents have emerged as a promising paradigm for digital task automation, yet transitioning from benchmark-oriented models to dependable real-world applications remai…