3 papers
cs.CV2025
Revisit the Imbalance Optimization in Multi-task Learning: An Experimental Analysis
Yihang Guo, Tianyuan Yu, Liang Bai +4
Multi-task learning (MTL) aims to build general-purpose vision systems by training a single network to perform multiple tasks jointly. While promising, its potential is often hinde…
cs.CV2025
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
Hongyang Wei, Baixin Xu, Hongbo Liu +18
Recent advances in multimodal models have demonstrated impressive capabilities in unified image generation and editing. However, many prominent open-source models prioritize scalin…
cs.RO2025
Evaluation of Habitat Robotics using Large Language Models
William Li, Lei Hamilton, Kaise Al-natour +1
This paper focuses on evaluating the effectiveness of Large Language Models at solving embodied robotic tasks using the Meta PARTNER benchmark. Meta PARTNR provides simplified envi…