3 papers
cs.RO2025
GLUE: Global-Local Unified Encoding for Imitation Learning via Key-Patch Tracking
Ye Chen, Zichen Zhou, Jianyu Dou +3
In recent years, visual representation learning has gained widespread attention in robotic imitation learning. However, in complex Out-of-Distribution(OOD) settings characterized b…
cs.CV2025
MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting
Yuheng Li, Yenho Chen, Yuxiang Lai +3
Radiologic diagnostic errors-under-reading errors, inattentional blindness, and communication failures-remain prevalent in clinical practice. These issues often stem from missed lo…
eess.IV2025
MANGO: Learning Disentangled Image Transformation Manifolds with Grouped Operators
Brighton Ancelin, Yenho Chen, Peimeng Guan +4
Learning semantically meaningful image transformations (i.e. rotation, thickness, blur) directly from examples can be a challenging task. Recently, the Manifold Autoencoder (MAE) p…