Publications (184)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
Songhao Han, Wei Huang, Hairong Shi +7
SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects
Bowen Jing, Mingxin Wang, Ruiyang Hao +15
ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?
Han Li, Si Liu, Zehao Huang +6
Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection
Jiahui Fu, Chen Gao, Zitian Wang +4
VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples
Qixin Sun, Ziqin Wang, Hengyuan Zhao +6
OctoNav: Towards Generalist Embodied Navigation
Chen Gao, Liankai Jin, Xingyu Peng +5
Anchor3DLane++: 3D Lane Detection via Sample-Adaptive Sparse 3D Anchor Regression
Shaofei Huang, Zhenwei Shen, Zehao Huang +4
Deep Human Parsing with Active Template Regression
Xiaodan Liang, Si Liu, Xiaohui Shen +5
LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction
Penghui Du, Yu Wang, Yifan Sun +7
ReSimAD: Zero-Shot 3D Domain Transfer for Autonomous Driving with Source Reconstruction and Target Simulation
Bo Zhang, Xinyu Cai, Jiakang Yuan +10
Computational Baby Learning
Xiaodan Liang, Si Liu, Yunchao Wei +3
Human-centric Relation Segmentation: Dataset and Solution
Si Liu, Zitian Wang, Yulu Gao +5
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
Hongrui Jia, Jitong Liao, Xi Zhang +7
3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive Selection
Junyu Luo, Jiahui Fu, Xianghao Kong +5
Linguistic Structure Guided Context Modeling for Referring Image Segmentation
Tianrui Hui, Si Liu, Shaofei Huang +4
CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation
Yi Liu, Shengqian Li, Zuzeng Lin +2
Omnidirectional Information Gathering for Knowledge Transfer-based Audio-Visual Navigation
Jinyu Chen, Wenguan Wang, Si Liu +2
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
Weikang Shi, Aldrich Yu, Rongyao Fang +11
Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding
Hongyu Li, Tianrui Hui, Zihan Ding +5
GEN-VLKT: Simplify Association and Enhance Interaction Understanding for HOI Detection
Yue Liao, Aixi Zhang, Miao Lu +3
Enhancing 3D Lane Detection and Topology Reasoning with 2D Lane Priors
Han Li, Zehao Huang, Zitian Wang +3
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
Hongyu Li, Manyuan Zhang, Dian Zheng +11
PSGAN++: Robust Detail-Preserving Makeup Transfer and Removal
Si Liu, Wentao Jiang, Chen Gao +4
Collaborative Spatial-Temporal Modeling for Language-Queried Video Actor Segmentation
Tianrui Hui, Shaofei Huang, Si Liu +5
Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
Zitian Wang, Yue Liao, Kang Rong +3
A Formal Framework for Predicting Distributed System Performance under Faults (Extended Version)
Ziwei Zhou, Si Liu, Zhou Zhou +2
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation
Yulu Gao, Bohao Zhang, Zongheng Tang +3
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
Rongyao Fang, Aldrich Yu, Chengqi Duan +7
Cross-Modality Domain Adaptation for Freespace Detection: A Simple yet Effective Baseline
Yuanbin Wang, Leyan Zhu, Shaofei Huang +4
Open Category Detection with PAC Guarantees
Si Liu, Risheek Garrepalli, Thomas G. Dietterich +2
BiCoord: A Bimanual Manipulation Benchmark towards Long-Horizon Spatial-Temporal Coordination
Xingyu Peng, Chen Gao, Liankai Jin +2
Factuality Matters: When Image Generation and Editing Meet Structured Visuals
Le Zhuo, Songhao Han, Yuandong Pu +8
Object-Aware Distillation Pyramid for Open-Vocabulary Object Detection
Luting Wang, Yi Liu, Penghui Du +5
DETR with Additional Global Aggregation for Cross-domain Weakly Supervised Object Detection
Zongheng Tang, Yifan Sun, Si Liu +1
UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning
Xiangyu Wang, Donglin Yang, Yue Liao +5
Pushing the Limit: Verified Performance-Optimal Causally-Consistent Database Transactions
Shabnam Ghasemirad, Christoph Sprenger, Si Liu +2
Knowledge Distillation via Query Selection for Detection Transformer
Yi Liu, Luting Wang, Zongheng Tang +4
TransRefer3D: Entity-and-Relation Aware Transformer for Fine-Grained 3D Visual Grounding
Dailan He, Yusheng Zhao, Junyu Luo +4
Differentiable Multi-Granularity Human Representation Learning for Instance-Aware Human Semantic Parsing
Tianfei Zhou, Wenguan Wang, Si Liu +2
Revisiting Audio-Visual Segmentation with Vision-Centric Transformer
Shaofei Huang, Rui Ling, Tianrui Hui +6
Reinforced Structured State-Evolution for Vision-Language Navigation
Jinyu Chen, Chen Gao, Erli Meng +2
Boosting End-to-End Database Isolation Checking via Mini-Transactions (Extended Version)
Hengfeng Wei, Jiang Xiao, Na Yang +4
MC#: Mixture Compressor for Mixture-of-Experts Large Models
Wei Huang, Yue Liao, Yukang Chen +6
MIH-TCCT: Mitigating Inconsistent Hallucinations in LLMs via Event-Driven Text-Code Cyclic Training
Xinxin You, Xien Liu, Qixin Sun +7
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
Runze He, Kai Ma, Linjiang Huang +6
Asynchronous Large Language Model Enhanced Planner for Autonomous Driving
Yuan Chen, Zi-han Ding, Ziqin Wang +3
Efficient Black-box Checking of Snapshot Isolation in Databases
Kaile Huang, Si Liu, Zhenge Chen +4
Unifying Qualitative and Quantitative Safety Verification of DNN-Controlled Systems
Dapeng Zhi, Peixin Wang, Si Liu +2
V2X-PC: Vehicle-to-everything Collaborative Perception via Point Cluster
Si Liu, Zihan Ding, Jiahui Fu +4
TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation
Linqing Zhong, Chen Gao, Zihan Ding +5
RGB-Infrared Cross-Modality Person Re-Identification via Joint Pixel and Feature Alignment
Guan'an Wang, Tianzhu Zhang, Jian Cheng +3
Mining the Benefits of Two-stage and One-stage HOI Detection
Aixi Zhang, Yue Liao, Si Liu +4
Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation
Donglin Yang, Haoran Chen, Xingyu Chen +6
Object as Query: Lifting any 2D Object Detector to 3D Detection
Zitian Wang, Zehao Huang, Jiahui Fu +2
ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics
Ziyu Wei, Luting Wang, Chen Gao +2
"Hi AirStar, Guide Me to the Badminton Court."
Ziqin Wang, Jinyu Chen, Xiangyi Zheng +3
MV2DFusion: Leveraging Modality-Specific Object Semantics for Multi-Modal 3D Detection
Zitian Wang, Zehao Huang, Yulu Gao +2
Ensemble Soft-Margin Softmax Loss for Image Classification
Xiaobo Wang, Shifeng Zhang, Zhen Lei +3
RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation
Ziqin Wang, Hao Li, Weijun Wang +5
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
Xiangyu Wang, Donglin Yang, Ziqin Wang +6
Recapture as You Want
Chen Gao, Si Liu, Ran He +2
CR-Solver: GPU-Accelerated Kinematics Solver for Tendon-driven Continuum Robots
Heqing Yang, Yang Yi, Linqing Zhong +2
The paper introduces CR-Solver, a GPU‑accelerated optimization framework that solves inverse kinematics, path following, and trajectory planning for tendon‑driven continuum robots…
Data Augmentation in Human-Centric Vision
Wentao Jiang, Yige Zhang, Shaozhong Zheng +2
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
Hongyu Li, Jinyu Chen, Ziyu Wei +5
Global-Local Collaborative Inference with LLM for Lidar-Based Open-Vocabulary Detection
Xingyu Peng, Yan Bai, Chen Gao +5
Human-centric Spatio-Temporal Video Grounding With Visual Transformers
Zongheng Tang, Yue Liao, Si Liu +5
AdversarialNAS: Adversarial Neural Architecture Search for GANs
Chen Gao, Yunpeng Chen, Si Liu +2
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
Yuwei Ning, Ganlong Zhao, Yipeng Qin +4
From Instruction to Event: Sound-Triggered Mobile Manipulation
Hao Ju, Shaofei Huang, Hongyu Li +4
Towards Realistic Earth-Observation Constellation Scheduling: Benchmark and Methodology
Luting Wang, Yinghao Xiang, Hongliang Huang +3
DOMR: Establishing Cross-View Segmentation via Dense Object Matching
Jitong Liao, Yulu Gao, Shaofei Huang +4
GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation
Boxiang Qiu, Liliang Chen, Yue Liao +12
Video2BEV: Transforming Drone Videos to BEVs for Video-based Geo-localization
Hao Ju, Shaofei Huang, Si Liu +1
Cross-domain Human Parsing via Adversarial Feature and Label Adaptation
Si Liu, Yao Sun, Defa Zhu +4
FeatAug-DETR: Enriching One-to-Many Matching for DETRs with Feature Augmentation
Rongyao Fang, Peng Gao, Aojun Zhou +4
Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation
Shaofei Huang, Rui Ling, Hongyu Li +5
A Tale of Two Approximations: Tightening Over-Approximation for DNN Robustness Verification via Under-Approximation
Zhiyi Xue, Si Liu, Zhaodi Zhang +2
Taming Reachability Analysis of DNN-Controlled Systems via Abstraction-Based Training
Jiaxu Tian, Dapeng Zhi, Si Liu +3
Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning
Hohin Kwan, Hongyu Li, Ray Zhang +5
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
Baisen Wang, Le Zhuo, Zhaokai Wang +7
AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
Yuting Gao, Wang Lan, Hengyuan Zhao +3
Video Background Music Generation with Controllable Music Transformer
Shangzhe Di, Zeren Jiang, Si Liu +5
Adversarial Data Collection: Human-Collaborative Perturbations for Efficient and Robust Robotic Imitation Learning
Siyuan Huang, Yue Liao, Siyuan Feng +5
Boosting Verified Training for Robust Image Classifications via Abstraction
Zhaodi Zhang, Zhiyi Xue, Yang Chen +4
CoFi-UCGen: Coarse-to-Fine Unsupervised Conditional Generation without Label Priors
Shengxi Li, Zhaokun Hu, Ce Zheng +3
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
Hongyu Li, Songhao Han, Yue Liao +4
FlexDrive: Toward Trajectory Flexibility in Driving Scene Reconstruction and Rendering
Jingqiu Zhou, Lue Fan, Linjiang Huang +4
Image Understanding Makes for A Good Tokenizer for Image Generation
Luting Wang, Yang Zhao, Zijian Zhang +3
Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior
Jiahui Fu, Zehao Huang, Han Li +2
Mask-Enhanced Segment Anything Model for Tumor Lesion Semantic Segmentation
Hairong Shi, Songhao Han, Shaofei Huang +6
Improving Weakly Supervised Temporal Action Localization by Bridging Train-Test Gap in Pseudo Labels
Jingqiu Zhou, Linjiang Huang, Liang Wang +2
Masked Contrastive Pre-Training for Efficient Video-Text Retrieval
Fangxun Shu, Biaolong Chen, Yue Liao +6
Referring Image Segmentation via Cross-Modal Progressive Comprehension
Shaofei Huang, Tianrui Hui, Si Liu +5
Geometry-Guided 3D Visual Token Pruning for Video-Language Models
Han Li, Zehao Huang, Jiahui Fu +2
RATopo: Improving Lane Topology Reasoning via Redundancy Assignment
Han Li, Shaofei Huang, Longfei Xu +3
LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT
Le Zhuo, Ruibin Yuan, Jiahao Pan +10
Multi-view Human Body Mesh Translator
Xiangjian Jiang, Xuecheng Nie, Zitian Wang +2
Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation
Shaofei Huang, Han Li, Yuqing Wang +5
GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation
Zijian Zhang, Yuqing Jiang, Qian Cheng +6
LLMs Can Unlearn Refusal with Only 1,000 Benign Samples
Yangyang Guo, Ziwei Xu, Si Liu +2