papers
Publications (11)
cs.CV2026
PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models
Zihan Song, Shuo Ye, Bo Zhao +4
cs.AI2026
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
Shuquan Lian, Yuhang Wu, Jia Ma +6
cs.RO2026
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
Jianli Sun, Bin Tian, Qiyao Zhang +5
cs.CV2024
LLM4VG: Large Language Models Evaluation for Video Grounding
Wei Feng, Xin Wang, Hong Chen +7
eess.SP2025
SWIPTNet: A Unified Deep Learning Framework for SWIPT based on GNN and Transfer Learning
Hong Han, Yang Lu, Zihan Song +5
cs.CV2026
AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
Jiayu Zhang, Shuo Ye, Qilang Ye +3
cs.CV2026
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
Jiayu Zhang, Shuo Ye, Qilang Ye +3
cs.CV2023
Grounding-Prompter: Prompting LLM with Multimodal Information for Temporal Sentence Grounding in Long Videos
Houlun Chen, Xin Wang, Hong Chen +3
cs.CV2023
VTimeLLM: Empower LLM to Grasp Video Moments
Bin Huang, Xin Wang, Hong Chen +2
cs.CV2026
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
Qiyao Zhang, Shuhua Zheng, Jianli Sun +6
eess.SP2026
Two-Stage Heterogeneous Graph Neural Network for RIS-Aided Physical-Layer Security
Zihan Song, Yang Lu, Wei Chen +3