3 papers
cs.RO2026
ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation
Weisheng Dai, Kai Lan, Jianyi Zhou +5
Vision-Language-Action (VLA) models achieve preliminary generalization through pretraining on large scale robot teleoperation datasets. However, acquiring datasets that comprehensi…
cs.CL2025
FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design
Kai Lan, Jiayong Zhu, Jiangtong Li +3
Large Multimodal Models (LMMs) demonstrate significant cross-modal reasoning capabilities. However, financial applications face challenges due to the lack of high-quality multimoda…
cs.CV2025
Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLM
Xinyu Fang, Zhijian Chen, Kai Lan +10
Creativity is a fundamental aspect of intelligence, involving the ability to generate novel and appropriate solutions across diverse contexts. While Large Language Models (LLMs) ha…