5 papers
Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model
Zizhao Yuan, Zhengtu Liang, Taowen Wang +7
Recent advances in action-conditioned world models show promising progress in modeling complex interactions and forecasting future states under diverse action sequences. While thes…
HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning
Taowen Wang, Zikang Xie, Bin Yang +13
Humanoid robots promise whole-body interaction in human-centered environments, but scalable policy learning remains difficult because task-level decision-making and whole-body dyna…
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents
Hao Cheng, Changtao Miao, Tianle Song +21
Autonomous LLM agents increasingly operate in stateful environments where they access tools, files, memory, and external services. While such capabilities enable complex real-world…
Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
Hao Cheng, Erjia Xiao, Yichi Wang +8
Current Cross-Modality Generation Models (GMs) demonstrate remarkable capabilities in various generative tasks. Given the ubiquity and information richness of vision modality input…
Transfer Attack for Bad and Good: Explain and Boost Adversarial Transferability across Multimodal Large Language Models
Hao Cheng, Erjia Xiao, Jiayan Yang +8
Multimodal Large Language Models (MLLMs) demonstrate exceptional performance in cross-modality interaction, yet they also suffer adversarial vulnerabilities. In particular, the tra…