2 papers
cs.AR2026
TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI
Hyunwoo Oh, Hanning Chen, Sanggeon Yun +5
Multimodal stacks that mix ViTs, CNNs, GNNs, and transformer NLP strain embedded platforms because their compute/memory patterns diverge and hard real-time targets leave little sla…
cs.CV2024
VLTP: Vision-Language Guided Token Pruning for Task-Oriented Segmentation
Hanning Chen, Yang Ni, Wenjun Huang +6
Vision Transformers (ViTs) have emerged as the backbone of many segmentation models, consistently achieving state-of-the-art (SOTA) performance. However, their success comes at a s…