embodied agents 1process-level safety 1safety evaluation 1spatial relations 1vision-language models 1
From the 1 of 3 linked papers with an AI index.
3 papers
cs.RO2026
SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
Huaigang Yang, Ya Li, Min Ren +3
The paper introduces SAFERELBENCH, a benchmark that evaluates how vision‑language‑driven embodied agents maintain safety during actions by focusing on spatial relations like suppor…
cs.CV2026
Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection
Jiaxin Liu, Jia Wang, Saihui Hou +5
In recent years, the explosive advancement of deepfake technology has posed a critical and escalating threat to public security: diffusion-based digital human generation. Unlike tr…
cs.AI2025
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
Fuqing Bie, Shiyu Huang, Xijia Tao +6
While generalist foundation models like Gemini and GPT-4o demonstrate impressive multi-modal competence, existing evaluations fail to test their intelligence in dynamic, interactiv…