collaborators

5 papers

cs.CV2026

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

Yuhang Song, Bor-Jiun Lin, Jiaxu Liu +3

Historical context integration presents a fundamental challenge for Vision-Language Models (VLMs) in sequential decision-making tasks. Current VLMs process visual inputs independen…

cs.CV2026

Landscape-Awareness for Geometric View Diffusion Model

Yan-Ting Chen, Hao-Wei Chen, Tsu-Ching Hsiao +1

Accurate camera viewpoint estimation under sparse-view conditions remains challenging, particularly in two-view scenarios. Recent approaches leverage diffusion models such as Zero1…

cs.SD2026

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien +5

While Large Audio-Language Models (LALMs) have been shown to exhibit degraded instruction-following capabilities, their ability to infer task patterns from in-context examples unde…

cs.CV2025

MVA 2025 Small Multi-Object Tracking for Spotting Birds Challenge: Dataset, Methods, and Results

Yuki Kondo, Norimichi Ukita, Riku Kanayama +21

Small Multi-Object Tracking (SMOT) is particularly challenging when targets occupy only a few dozen pixels, rendering detection and appearance-based association unreliable. Buildin…

cs.LG2025

EDELINE: Enhancing Memory in Diffusion-based World Models via Linear-Time Sequence Modeling

Jia-Hua Lee, Bor-Jiun Lin, Wei-Fang Sun +1

World models represent a promising approach for training reinforcement learning agents with significantly improved sample efficiency. While most world model methods primarily rely…