activity
20242026
collaborators

5 papers

cs.LG2026

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

Xiaoce Wang, Guibin Zhang, Junzhe Li +3

Existing GUI agent models relying on coordinate-based one-step visual grounding struggle with generalizing to varying input resolutions and aspect ratios. Alternatives introduce co…

cs.RO2025

FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation

Cui Miao, Tao Chang, Meihan Wu +4

Vision-language-action (VLA) models have significantly advanced robotic manipulation by enabling robots to interpret language instructions for task execution. However, training the…

cs.CV2025

Robust Brain Tumor Segmentation with Incomplete MRI Modalities Using Hölder Divergence and Mutual Information-Enhanced Knowledge Transfer

Runze Cheng, Xihang Qiu, Ming Li +3

Multimodal MRI provides critical complementary information for accurate brain tumor segmentation. However, conventional methods struggle when certain modalities are missing due to…

cs.CV2024

EFTViT: Efficient Federated Training of Vision Transformers with Masked Images on Resource-Constrained Clients

Meihan Wu, Tao Chang, Cui Miao +5

Federated learning research has recently shifted from Convolutional Neural Networks (CNNs) to Vision Transformers (ViTs) due to their superior capacity. ViTs training demands highe…

cs.CV2024

Uncertainty Quantification via Hölder Divergence for Multi-View Representation Learning

Yan Zhang, Ming Li, Chun Li +3

Evidence-based deep learning represents a burgeoning paradigm for uncertainty estimation, offering reliable predictions with negligible extra computational overheads. Existing meth…