1 citations · 1 across the 2 of their papers we have counts for
2 papers
cs.CV2025
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
Shuai Li, Jian Xu, Xiao-Hui Li +2
Recent advances in Multi-modal Large Language Models (MLLMs) have shown significant progress in open-world Visual Question Answering (VQA). However, integrating visual information…
cs.CV2024★ 1 cited
Hint-AD: Holistically Aligned Interpretability in End-to-End Autonomous Driving
Kairui Ding, Boyuan Chen, Yuchen Su +8
End-to-end architectures in autonomous driving (AD) face a significant challenge in interpretability, impeding human-AI trust. Human-friendly natural language has been explored for…