2 papers
cs.CV2026
GameReplica: A Benchmark for Black-Box Visual Game Replication by Vision-Language Agents
Boyu Qiao, Zixin Tang, Xiaoshuai Hao +1
Coding-agent benchmarks usually evaluate implementation after the target behavior has been specified in text, code, or demonstrations. Existing research has extensively evaluated t…
cs.AI2026
ReflectFact: Self-Reflective Agents for Improving Comprehension and Reasoning in Multi-Hop Fact Verification
Runze Zhao, Zixin Tang, Xiaoshuai Hao +4
Multi-hop fact verification, which verifies claims by reasoning over multiple pieces of evidence, is critical for combating misinformation on social media yet remains highly challe…