1 citations · 2 across the 3 of their papers we have counts for
3 papers
Scope: Selective Cross-modal Orchestration of Visual Perception Experts
Tianyu Zhang, Suyuchen Wang, Chao Wang +5
Vision-language models (VLMs) benefit from multiple vision encoders, but naively stacking them yields diminishing returns while multiplying inference costs. We propose SCOPE, a Mix…
OCR-VQGAN: Taming Text-within-Image Generation
Juan A. Rodriguez, David Vazquez, Issam Laradji +2
Synthetic image generation has recently experienced significant improvements in domains such as natural image or art generation. However, the problem of figure and diagram generati…
TrackNet: A Triplet metric-based method for Multi-Target Multi-Camera Vehicle Tracking
David Serrano, Francesc Net, Juan Antonio Rodríguez +1
We present TrackNet, a method for Multi-Target Multi-Camera (MTMC) vehicle tracking from traffic video sequences. Cross-camera vehicle tracking has proved to be a challenging task…