106 citations · 119 across the 3 of their papers we have counts for
4 papers
Ziya-Visual: Bilingual Large Vision-Language Model via Multi-Task Instruction Tuning
Junyu Lu, Dixiang Zhang, Xiaojun Wu +5
Recent advancements enlarge the capabilities of large language models (LLMs) in zero-shot image-to-text generation and understanding by integrating multi-modal inputs. However, suc…
Improving Facade Parsing with Vision Transformers and Line Integration
Bowen Wang, Jiaxing Zhang, Ran Zhang +3
Facade parsing stands as a pivotal computer vision task with far-reaching applications in areas like architecture, urban planning, and energy efficiency. Despite the recent success…
The Application of Two-level Attention Models in Deep Convolutional Neural Network for Fine-grained Image Classification
Tianjun Xiao, Yichong Xu, Kuiyuan Yang +3
Fine-grained classification is challenging because categories can only be discriminated by subtle and local differences. Variances in the pose, scale or rotation usually make the p…
Scale-Invariant Convolutional Neural Networks
Yichong Xu, Tianjun Xiao, Jiaxing Zhang +2
Even though convolutional neural networks (CNN) has achieved near-human performance in various computer vision tasks, its ability to tolerate scale variations is limited. The popul…