NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (184)

cs.CV2024

VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection

Songhao Han, Wei Huang, Hairong Shi +7

cs.RO2026

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

Bowen Jing, Mingxin Wang, Ruiyang Hao +15

cs.CV2026

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

Han Li, Si Liu, Zehao Huang +6

cs.CV2024

Eliminating Cross-modal Conflicts in BEV Space for LiDAR-Camera 3D Object Detection

Jiahui Fu, Chen Gao, Zitian Wang +4

cs.CL2025

VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples

Qixin Sun, Ziqin Wang, Hengyuan Zhao +6

cs.CV2025

OctoNav: Towards Generalist Embodied Navigation

Chen Gao, Liankai Jin, Xingyu Peng +5

cs.CV2024

Anchor3DLane++: 3D Lane Detection via Sample-Adaptive Sparse 3D Anchor Regression

Shaofei Huang, Zhenwei Shen, Zehao Huang +4

cs.CV2015

Deep Human Parsing with Active Template Regression

Xiaodan Liang, Si Liu, Xiaohui Shen +5

cs.CV2024

LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction

Penghui Du, Yu Wang, Yifan Sun +7

cs.CV2024

ReSimAD: Zero-Shot 3D Domain Transfer for Autonomous Driving with Source Reconstruction and Target Simulation

Bo Zhang, Xinyu Cai, Jiakang Yuan +10

cs.CV2015

Computational Baby Learning

Xiaodan Liang, Si Liu, Yunchao Wei +3

cs.CV2021

Human-centric Relation Segmentation: Dataset and Solution

Si Liu, Zitian Wang, Yulu Gao +5

cs.CV2025

OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents

Hongrui Jia, Jitong Liao, Xi Zhang +7

cs.CV2022

3D-SPS: Single-Stage 3D Visual Grounding via Referred Point Progressive Selection

Junyu Luo, Jiahui Fu, Xianghao Kong +5

cs.CV2020

Linguistic Structure Guided Context Modeling for Referring Image Segmentation

Tianrui Hui, Si Liu, Shaofei Huang +4

cs.CV2025

CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation

Yi Liu, Shengqian Li, Zuzeng Lin +2

cs.CV2023

Omnidirectional Information Gathering for Knowledge Transfer-based Audio-Visual Navigation

Jinyu Chen, Wenguan Wang, Si Liu +2

cs.CV2025

MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning

Weikang Shi, Aldrich Yu, Rongyao Fang +11

cs.CV2024

Dynamic Prompting of Frozen Text-to-Image Diffusion Models for Panoptic Narrative Grounding

Hongyu Li, Tianrui Hui, Zihan Ding +5

cs.CV2022

GEN-VLKT: Simplify Association and Enhance Interaction Understanding for HOI Detection

Yue Liao, Aixi Zhang, Miao Lu +3

cs.CV2024

Enhancing 3D Lane Detection and Topology Reasoning with 2D Lane Priors

Han Li, Zehao Huang, Zitian Wang +3

cs.CV2025

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

Hongyu Li, Manyuan Zhang, Dian Zheng +11

cs.CV2021

PSGAN++: Robust Detail-Preserving Makeup Transfer and Removal

Si Liu, Wentao Jiang, Chen Gao +4

cs.CV2021

Collaborative Spatial-Temporal Modeling for Language-Queried Video Actor Segmentation

Tianrui Hui, Shaofei Huang, Si Liu +5

cs.CV2025

Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs

Zitian Wang, Yue Liao, Kang Rong +3

cs.DC2026

A Formal Framework for Predicting Distributed System Performance under Faults (Extended Version)

Ziwei Zhou, Si Liu, Zhou Zhou +2

cs.CV2026

VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation

Yulu Gao, Bohao Zhang, Zongheng Tang +3

cs.CV2025

FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark

Rongyao Fang, Aldrich Yu, Chengqi Duan +7

cs.CV2022

Cross-Modality Domain Adaptation for Freespace Detection: A Simple yet Effective Baseline

Yuanbin Wang, Leyan Zhu, Shaofei Huang +4

cs.LG2018

Open Category Detection with PAC Guarantees

Si Liu, Risheek Garrepalli, Thomas G. Dietterich +2

cs.RO2026

BiCoord: A Bimanual Manipulation Benchmark towards Long-Horizon Spatial-Temporal Coordination

Xingyu Peng, Chen Gao, Liankai Jin +2

cs.CV2026

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

Le Zhuo, Songhao Han, Yuandong Pu +8

cs.CV2023

Object-Aware Distillation Pyramid for Open-Vocabulary Object Detection

Luting Wang, Yi Liu, Penghui Du +5

cs.CV2023

DETR with Additional Global Aggregation for Cross-domain Weakly Supervised Object Detection

Zongheng Tang, Yifan Sun, Si Liu +1

cs.RO2025

UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning

Xiangyu Wang, Donglin Yang, Yue Liao +5

cs.DB2025

Pushing the Limit: Verified Performance-Optimal Causally-Consistent Database Transactions

Shabnam Ghasemirad, Christoph Sprenger, Si Liu +2

cs.CV2024

Knowledge Distillation via Query Selection for Detection Transformer

Yi Liu, Luting Wang, Zongheng Tang +4

cs.CV2021

TransRefer3D: Entity-and-Relation Aware Transformer for Fine-Grained 3D Visual Grounding

Dailan He, Yusheng Zhao, Junyu Luo +4

cs.CV2021

Differentiable Multi-Granularity Human Representation Learning for Instance-Aware Human Semantic Parsing

Tianfei Zhou, Wenguan Wang, Si Liu +2

cs.CV2025

Revisiting Audio-Visual Segmentation with Vision-Centric Transformer

Shaofei Huang, Rui Ling, Tianrui Hui +6

cs.CV2022

Reinforced Structured State-Evolution for Vision-Language Navigation

Jinyu Chen, Chen Gao, Erli Meng +2

cs.DB2025

Boosting End-to-End Database Isolation Checking via Mini-Transactions (Extended Version)

Hengfeng Wei, Jiang Xiao, Na Yang +4

cs.LG2025

MC#: Mixture Compressor for Mixture-of-Experts Large Models

Wei Huang, Yue Liao, Yukang Chen +6

cs.AI2025

MIH-TCCT: Mitigating Inconsistent Hallucinations in LLMs via Event-Driven Text-Code Cyclic Training

Xinxin You, Xien Liu, Qixin Sun +7

cs.CV2024

FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction

Runze He, Kai Ma, Linjiang Huang +6

cs.RO2024

Asynchronous Large Language Model Enhanced Planner for Autonomous Driving

Yuan Chen, Zi-han Ding, Ziqin Wang +3

cs.DB2023

Efficient Black-box Checking of Snapshot Isolation in Databases

Kaile Huang, Si Liu, Zhenge Chen +4

cs.LG2024

Unifying Qualitative and Quantitative Safety Verification of DNN-Controlled Systems

Dapeng Zhi, Peixin Wang, Si Liu +2

cs.CV2024

V2X-PC: Vehicle-to-everything Collaborative Perception via Point Cluster

Si Liu, Zihan Ding, Jiahui Fu +4

cs.CV2025

TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation

Linqing Zhong, Chen Gao, Zihan Ding +5

cs.CV2019

RGB-Infrared Cross-Modality Person Re-Identification via Joint Pixel and Feature Alignment

Guan'an Wang, Tianzhu Zhang, Jian Cheng +3

cs.CV2021

Mining the Benefits of Two-stage and One-stage HOI Detection

Aixi Zhang, Yue Liao, Si Liu +4

cs.RO2026

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

Donglin Yang, Haoran Chen, Xingyu Chen +6

cs.CV2023

Object as Query: Lifting any 2D Object Detector to 3D Detection

Zitian Wang, Zehao Huang, Jiahui Fu +2

cs.RO2026

ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics

Ziyu Wei, Luting Wang, Chen Gao +2

cs.RO2025

"Hi AirStar, Guide Me to the Badminton Court."

Ziqin Wang, Jinyu Chen, Xiangyi Zheng +3

cs.CV2025

MV2DFusion: Leveraging Modality-Specific Object Semantics for Multi-Modal 3D Detection

Zitian Wang, Zehao Huang, Yulu Gao +2

cs.CV2018

Ensemble Soft-Margin Softmax Loss for Image Classification

Xiaobo Wang, Shifeng Zhang, Zhen Lei +3

cs.RO2026

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

Ziqin Wang, Hao Li, Weijun Wang +5

cs.CV2024

Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology

Xiangyu Wang, Donglin Yang, Ziqin Wang +6

cs.CV2020

Recapture as You Want

Chen Gao, Si Liu, Ran He +2

cs.RO2026

CR-Solver: GPU-Accelerated Kinematics Solver for Tendon-driven Continuum Robots

Heqing Yang, Yang Yi, Linqing Zhong +2

The paper introduces CR-Solver, a GPU‑accelerated optimization framework that solves inverse kinematics, path following, and trajectory planning for tendon‑driven continuum robots…

#continuum robots#tendon-driven actuation#kinematics solving#gpu acceleration
cs.CV2024

Data Augmentation in Human-Centric Vision

Wentao Jiang, Yige Zhang, Shaozhong Zheng +2

cs.CV2025

LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding

Hongyu Li, Jinyu Chen, Ziyu Wei +5

cs.CV2024

Global-Local Collaborative Inference with LLM for Lidar-Based Open-Vocabulary Detection

Xingyu Peng, Yan Bai, Chen Gao +5

cs.CV2021

Human-centric Spatio-Temporal Video Grounding With Visual Transformers

Zongheng Tang, Yue Liao, Si Liu +5

cs.CV2020

AdversarialNAS: Adversarial Neural Architecture Search for GANs

Chen Gao, Yunpeng Chen, Si Liu +2

cs.CV2026

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

Yuwei Ning, Ganlong Zhao, Yipeng Qin +4

cs.RO2026

From Instruction to Event: Sound-Triggered Mobile Manipulation

Hao Ju, Shaofei Huang, Hongyu Li +4

cs.CV2025

Towards Realistic Earth-Observation Constellation Scheduling: Benchmark and Methodology

Luting Wang, Yinghao Xiang, Hongliang Huang +3

cs.CV2025

DOMR: Establishing Cross-View Segmentation via Dense Object Matching

Jitong Liao, Yulu Gao, Shaofei Huang +4

cs.RO2026

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

Boxiang Qiu, Liliang Chen, Yue Liao +12

cs.CV2025

Video2BEV: Transforming Drone Videos to BEVs for Video-based Geo-localization

Hao Ju, Shaofei Huang, Si Liu +1

cs.CV2018

Cross-domain Human Parsing via Adversarial Feature and Label Adaptation

Si Liu, Yao Sun, Defa Zhu +4

cs.CV2023

FeatAug-DETR: Enriching One-to-Many Matching for DETRs with Feature Augmentation

Rongyao Fang, Peng Gao, Aojun Zhou +4

cs.CV2024

Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation

Shaofei Huang, Rui Ling, Hongyu Li +5

cs.LG2023

A Tale of Two Approximations: Tightening Over-Approximation for DNN Robustness Verification via Under-Approximation

Zhiyi Xue, Si Liu, Zhaodi Zhang +2

cs.LG2023

Taming Reachability Analysis of DNN-Controlled Systems via Abstraction-Based Training

Jiaxu Tian, Dapeng Zhi, Si Liu +3

cs.CV2026

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Hohin Kwan, Hongyu Li, Ray Zhang +5

cs.CV2024

Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation

Baisen Wang, Le Zhuo, Zhaokai Wang +7

cs.LG2025

AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert

Yuting Gao, Wang Lan, Hengyuan Zhao +3

cs.MM2021

Video Background Music Generation with Controllable Music Transformer

Shangzhe Di, Zeren Jiang, Si Liu +5

cs.RO2025

Adversarial Data Collection: Human-Collaborative Perturbations for Efficient and Robust Robotic Imitation Learning

Siyuan Huang, Yue Liao, Siyuan Feng +5

cs.CV2023

Boosting Verified Training for Robust Image Classifications via Abstraction

Zhaodi Zhang, Zhiyi Xue, Yang Chen +4

cs.CV2026

CoFi-UCGen: Coarse-to-Fine Unsupervised Conditional Generation without Label Priors

Shengxi Li, Zhaokun Hu, Ce Zheng +3

cs.CV2025

Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency

Hongyu Li, Songhao Han, Yue Liao +4

cs.CV2025

FlexDrive: Toward Trajectory Flexibility in Driving Scene Reconstruction and Rendering

Jingqiu Zhou, Lue Fan, Linjiang Huang +4

cs.CV2024

Image Understanding Makes for A Good Tokenizer for Image Generation

Luting Wang, Yang Zhao, Zijian Zhang +3

cs.CV2026

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

Jiahui Fu, Zehao Huang, Han Li +2

eess.IV2024

Mask-Enhanced Segment Anything Model for Tumor Lesion Semantic Segmentation

Hairong Shi, Songhao Han, Shaofei Huang +6

cs.CV2023

Improving Weakly Supervised Temporal Action Localization by Bridging Train-Test Gap in Pseudo Labels

Jingqiu Zhou, Linjiang Huang, Liang Wang +2

cs.CV2022

Masked Contrastive Pre-Training for Efficient Video-Text Retrieval

Fangxun Shu, Biaolong Chen, Yue Liao +6

cs.CV2020

Referring Image Segmentation via Cross-Modal Progressive Comprehension

Shaofei Huang, Tianrui Hui, Si Liu +5

cs.CV2026

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

Han Li, Zehao Huang, Jiahui Fu +2

cs.CV2025

RATopo: Improving Lane Topology Reasoning via Redundancy Assignment

Han Li, Shaofei Huang, Longfei Xu +3

cs.CL2024

LyricWhiz: Robust Multilingual Zero-shot Lyrics Transcription by Whispering to ChatGPT

Le Zhuo, Ruibin Yuan, Jiahao Pan +10

cs.CV2022

Multi-view Human Body Mesh Translator

Xiangjian Jiang, Xuecheng Nie, Zitian Wang +2

cs.CV2023

Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation

Shaofei Huang, Han Li, Yuqing Wang +5

cs.RO2026

GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation

Zijian Zhang, Yuqing Jiang, Qian Cheng +6

cs.CR2026

LLMs Can Unlearn Refusal with Only 1,000 Benign Samples

Yangyang Guo, Ziwei Xu, Si Liu +2