2 papers
cs.CV2024
UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation
Guangzhao Dai, Jian Zhao, Yuantao Chen +6
Vision-and-Language Navigation (VLN), where an agent follows instructions to reach a target destination, has recently seen significant advancements. In contrast to navigation in di…
cs.LG2024
FedMLLM: Federated Fine-tuning MLLM on Multimodal Heterogeneity Data
Binqian Xu, Xiangbo Shu, Haiyang Mei +3
Multimodal Large Language Models (MLLMs) have made significant advancements, demonstrating powerful capabilities in processing and understanding multimodal data. Fine-tuning MLLMs…