3 papers
cs.CV2026
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
Peng-Fei Zhang, Zi Huang
Existing adversarial attacks for VLP models are mostly sample-specific, resulting in substantial computational overhead when scaled to large datasets or new scenarios. To overcome…
cs.CV2025
Language-driven Fine-grained Retrieval
Shijie Wang, Xin Yu, Yadan Luo +3
Existing fine-grained image retrieval (FGIR) methods learn discriminative embeddings by adopting semantically sparse one-hot labels derived from category names as supervision. Whil…
cs.RO2025
A Step Toward World Models: A Survey on Robotic Manipulation
Peng-Fei Zhang, Ying Cheng, Xiaofan Sun +4
Autonomous agents are increasingly expected to operate in complex, dynamic, and uncertain environments, performing tasks such as manipulation, navigation, and decision-making. Achi…