2 papers
cs.CV2026
REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding
Yan Tai, Luhao Zhu, Yunan Ding +4
Multimodal Large Language Models (MLLMs) demonstrate robust zero-shot capabilities across diverse vision-language tasks after training on mega-scale datasets. However, dense predic…
cs.RO2025
HuBE: Cross-Embodiment Human-like Behavior Execution for Humanoid Robots
Shipeng Lyu, Fangyuan Wang, Weiwei Lin +3
Achieving both behavioral similarity and appropriateness in human-like motion generation for humanoid robot remains an open challenge, further compounded by the lack of cross-embod…