NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (270)

cs.CV2021

Video Swin Transformer

Ze Liu, Jia Ning, Yue Cao +4

cs.CV2026

Gaze-Anchored Social Net: Decoding Implicit Relations via Joint Modeling

Yuqi Hou, Zhuo Chen, Han Hu +3

cs.CL2026

MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models

Xinming Wang, Jian Xu, Bin Yu +9

cs.DC2023

Tutel: Adaptive Mixture-of-Experts at Scale

Changho Hwang, Wei Cui, Yifan Xiong +12

cs.CY2025

Joint Sensing, Communication, and Computation for Vertical Federated Edge Learning in Edge Perception Network

Xiaowen Cao, Dingzhu Wen, Suzhi Bi +4

cs.LG2025

Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities

Zhiwei Hao, Jianyuan Guo, Li Shen +6

cs.IR2025

Hyper-RAG: Combating LLM Hallucinations using Hypergraph-Driven Retrieval-Augmented Generation

Yifan Feng, Hao Hu, Xingliang Hou +5

cs.CV2021

Aligning Pretraining for Detection via Object-Level Contrastive Learning

Fangyun Wei, Yue Gao, Zhirong Wu +2

cs.CV2026

GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?

Ruihang Li, Leigang Qu, Jingxu Zhang +6

cs.LG2026

ViroBench: Benchmarking Nucleotide Foundation Models on Viral Genomics Tasks

Dongxin Ye, Fang Hu, Han Hu +6

cs.SE2025

Bamboo: LLM-Driven Discovery of API-Permission Mappings in the Android Framework

Han Hu, Wei Minn, Yonghui Liu +6

cs.CL2026

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

Zhengyang Tang, Yi Zhang, Chenxin Li +18

cs.CV2025

Equivariant Image Modeling

Ruixiao Dong, Mengde Xu, Zigang Geng +3

cs.CR2018

Adaptive Laplace Mechanism: Differential Privacy Preservation in Deep Learning

NhatHai Phan, Xintao Wu, Han Hu +1

cs.CV2023

LGViT: Dynamic Early Exiting for Accelerating Vision Transformer

Guanyu Xu, Jiawei Hao, Li Shen +4

cs.CV2021

Propagate Yourself: Exploring Pixel-Level Consistency for Unsupervised Visual Representation Learning

Zhenda Xie, Yutong Lin, Zheng Zhang +3

cs.CV2020

RelationNet++: Bridging Visual Representations for Object Detection via Transformer Decoder

Cheng Chi, Fangyun Wei, Han Hu

cs.LG2026

Concrete Subspace Learning based Interference Elimination for Multi-task Model Fusion

Anke Tang, Xianglin Luo, Li Shen +5

cs.CV2025

LarvSeg: Exploring Image Classification Data For Large Vocabulary Semantic Segmentation via Category-wise Attentive Classifier

Haojun Yu, Di Dai, Ziwei Zhao +3

cs.CV2023

Exploring Non-additive Randomness on ViT against Query-Based Black-Box Attacks

Jindong Gu, Fangyun Wei, Philip Torr +1

cs.CV2022

CDFKD-MFS: Collaborative Data-free Knowledge Distillation via Multi-level Feature Sharing

Zhiwei Hao, Yong Luo, Zhi Wang +2

cs.SD2026

Omni-directional attention mechanism based on Mamba for speech separation

Ke Xue, Chang Sun, Rongfei Fan +2

cs.CV2025

ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters

Zhiwei Hao, Jianyuan Guo, Li Shen +4

cs.CV2026

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

Mingqi Gao, Hongyuan Dong, Yifei Chen +6

cs.CV2026

Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions

Kaiwen Zheng, Junchen Fu, Songpei Xu +4

cs.LG2022

Multi-Agent Collaborative Inference via DNN Decoupling: Intermediate Feature Compression and Edge Learning

Zhiwei Hao, Guanyu Xu, Yong Luo +3

eess.SY2021

Energy-Efficient Design for IRS-Assisted MEC Networks with NOMA

Qun Wang, Fuhui Zhou, Han Hu +1

cs.CV2022

Not All Instances Contribute Equally: Instance-adaptive Class Representation Learning for Few-Shot Visual Recognition

Mengya Han, Yibing Zhan, Yong Luo +4

cs.CV2022

On Data Scaling in Masked Image Modeling

Zhenda Xie, Zheng Zhang, Yue Cao +4

cs.NI2020

DeepRS: Deep-learning Based Network-Adaptive FEC for Real-Time Video Communications

Sheng Cheng, Han Hu, Xinggong Zhang +1

cs.CV2023

Domain-knowledge Inspired Pseudo Supervision (DIPS) for Unsupervised Image-to-Image Translation Models to Support Cross-Domain Classification

Firas Al-Hindawi, Md Mahfuzur Rahman Siddiquee, Teresa Wu +2

cs.LG2023

Federated Learning with Manifold Regularization and Normalized Update Reaggregation

Xuming An, Li Shen, Han Hu +1

cs.LG2023

FedABC: Targeting Fair Competition in Personalized Federated Learning

Dui Wang, Li Shen, Yong Luo +4

cs.CV2022

Could Giant Pretrained Image Models Extract Universal Representations?

Yutong Lin, Ze Liu, Zheng Zhang +4

cs.CV2018

Relation Networks for Object Detection

Han Hu, Jiayuan Gu, Zheng Zhang +2

cs.CV2021

Breaking Shortcut: Exploring Fully Convolutional Cycle-Consistency for Video Correspondence Learning

Yansong Tang, Zhenyu Jiang, Zhenda Xie +4

cs.CV2022

Swin Transformer V2: Scaling Up Capacity and Resolution

Ze Liu, Han Hu, Yutong Lin +9

cs.CV2019

Deep Metric Transfer for Label Propagation with Limited Annotated Data

Bin Liu, Zhirong Wu, Han Hu +1

eess.IV2023

SGDA: Towards 3D Universal Pulmonary Nodule Detection via Slice Grouped Domain Attention

Rui Xu, Zhi Liu, Yong Luo +5

cs.RO2026

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Yifu Yuan, Yaoting Huang, Xianze Yao +20

cs.CV2023

TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight Inheritance

Kan Wu, Houwen Peng, Zhenghong Zhou +10

cs.SE2024

StarCoder 2 and The Stack v2: The Next Generation

Anton Lozhkov, Raymond Li, Loubna Ben Allal +63

cs.CV2020

Negative Margin Matters: Understanding Margin in Few-shot Classification

Bin Liu, Yue Cao, Yutong Lin +4

cs.AI2026

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

Haotian Liang, Mingkang Chen, Yufei Huang +27

The paper introduces RxBrain, a foundation model that jointly reasons over language and visual inputs to create embodied plans, using a multimodal Mixture-of-Transformers architect…

#embodied cognition#multimodal reasoning#language-visual planning#foundation models
cs.CV2020

Parametric Instance Classification for Unsupervised Visual Feature Learning

Yue Cao, Zhenda Xie, Bin Liu +3

cs.CV2022

Exploring Discrete Diffusion Models for Image Captioning

Zixin Zhu, Yixuan Wei, Jianfeng Wang +7

cs.CV2017

WordSup: Exploiting Word Annotations for Character based Text Detection

Han Hu, Chengquan Zhang, Yuxuan Luo +3

cs.CV2023

BCE-Net: Reliable Building Footprints Change Extraction based on Historical Map and Up-to-Date Images using Contrastive Learning

Cheng Liao, Han Hu, Xuekun Yuan +6

cs.CV2026

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Ziyi Wang, Xumin Yu, Yongming Rao +19

cs.CV2021

Group-Free 3D Object Detection via Transformers

Ze Liu, Zheng Zhang, Yue Cao +2

cs.CV2025

RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs

Meng-Hao Guo, Xuanyu Chu, Qianrui Yang +12

cs.CV2022

A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model

Mengde Xu, Zheng Zhang, Fangyun Wei +4

cs.CV2022

Region Rebalance for Long-Tailed Semantic Segmentation

Jiequan Cui, Yuhui Yuan, Zhisheng Zhong +4

cs.CV2020

MAP-Net: Multi Attending Path Neural Network for Building Footprint Extraction from Remote Sensed Imagery

Qing Zhu, Cheng Liao, Han Hu +2

cs.LG2021

Robustness of on-device Models: Adversarial Attack to Deep Learning Models on Android Apps

Yujin Huang, Han Hu, Chunyang Chen

cs.IT2024

Secure Semantic Communications: From Perspective of Physical Layer Security

Yongkang Li, Zheng Shi, Han Hu +3

cs.CV2024

Multi-Granularity Hand Action Detection

Ting Zhe, Jing Zhang, Yongqian Li +3

cs.CV2025

Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information

Jie Li, Zhixin Li, Zhi Liu +4

cs.CV2023

V-DETR: DETR with Vertex Relative Position Encoding for 3D Object Detection

Yichao Shen, Zigang Geng, Yuhui Yuan +6

eess.IV2020

Deep Fusion of Local and Non-Local Features for Precision Landslide Recognition

Qing Zhu, Lin Chen, Han Hu +3

cs.CL2019

XCMRC: Evaluating Cross-lingual Machine Reading Comprehension

Pengyuan Liu, Yuning Deng, Chenghao Zhu +1

cs.CV2024

Segment and Caption Anything

Xiaoke Huang, Jianfeng Wang, Yansong Tang +5

cs.IT2021

Energy-efficient Task Offloading for Relay Aided Mobile Edge Computing under Sequential Task Dependency

Xiangg Li, Rongfei Fan, Han Hu

cs.CV2023

PartSeg: Few-shot Part Segmentation via Part-aware Prompt Learning

Mengya Han, Heliang Zheng, Chaoyue Wang +4

cs.LG2026

Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee

Shiyuan Zuo, Jiashuo Li, Rongfei Fan +2

cs.SE2024

Enhancing GUI Exploration Coverage of Android Apps with Deep Link-Integrated Monkey

Han Hu, Han Wang, Ruiqi Dong +2

cs.LG2023

Subspace based Federated Unlearning

Guanghao Li, Li Shen, Yan Sun +3

cs.CV2021

Boosting Adversarial Transferability through Enhanced Momentum

Xiaosen Wang, Jiadong Lin, Han Hu +2

cs.SE2025

BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions

Terry Yue Zhuo, Minh Chien Vu, Jenny Chim +30

cs.CV2025

What Time Tells Us? An Explorative Study of Time Awareness Learned from Static Images

Dongheng Lin, Han Hu, Jianbo Jiao

cs.CV2023

Multiple View Geometry Transformers for 3D Human Pose Estimation

Ziwei Liao, Jialiang Zhu, Chunyu Wang +2

cs.CV2023

StructuredMesh: 3D Structured Optimization of Façade Components on Photogrammetric Mesh Models using Binary Integer Programming

Libin Wang, Han Hu, Qisen Shang +2

cs.AI2026

Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics

Yimin Chen, Brian Fricke, Bo Shen +10

cs.LG2023

FLSys: Toward an Open Ecosystem for Federated Learning Mobile Apps

Xiaopeng Jiang, Han Hu, Vijaya Datta Mayyuri +6

cs.CV2025

Tokenize Image as a Set

Zigang Geng, Mengde Xu, Han Hu +1

cs.CV2026

FAIL: Flow Matching Adversarial Imitation Learning for Image Generation

Yeyao Ma, Chen Li, Xiaosong Zhang +2

cs.LG2024

Federated Learning with Only Positive Labels by Exploring Label Correlations

Xuming An, Dui Wang, Li Shen +5

cs.CV2023

EfficientViT: Memory Efficient Vision Transformer with Cascaded Group Attention

Xinyu Liu, Houwen Peng, Ningxin Zheng +3

cs.CV2021

Capsule Network is Not More Robust than Convolutional Network

Jindong Gu, Volker Tresp, Han Hu

stat.ML2025

Discovering Governing Equations in the Presence of Uncertainty

Ridwan Olabiyi, Han Hu, Ashif Iquebal

cs.CV2018

Deformable ConvNets v2: More Deformable, Better Results

Xizhou Zhu, Han Hu, Stephen Lin +1

eess.SP2025

Channel Knowledge Map Construction: Recent Advances and Open Challenges

Zixiang Ren, Juncong Zhou, Jie Xu +5

cs.CV2022

Leveraging GAN Priors for Few-Shot Part Segmentation

Mengya Han, Heliang Zheng, Chaoyue Wang +3

cs.LG2026

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo +4

cs.LG2023

Joint Power Control and Data Size Selection for Over-the-Air Computation Aided Federated Learning

Xuming An, Rongfei Fan, Shiyuan Zuo +3

eess.SY2021

Mobility-Aware Offloading and Resource Allocation in MEC-Enabled IoT Networks

Han Hu, Weiwei Song, Qun Wang +2

cs.CV2023

VanillaKD: Revisit the Power of Vanilla Knowledge Distillation from Small Scale to Large Scale

Zhiwei Hao, Jianyuan Guo, Kai Han +3

cs.CV2023

DETRs with Hybrid Matching

Ding Jia, Yuhui Yuan, Haodi He +6

cs.CV2023

Semantic Image Translation for Repairing the Texture Defects of Building Models

Qisen Shang, Han Hu, Haojia Yu +3

physics.app-ph2026

A Computational Model for Flexoelectricity-Driven Contact Electrification

Han Hu, Xiaoying Zhuang, Timon Rabczuk

eess.SP2023

AI Generated Signal for Wireless Sensing

Hanxiang He, Han Hu, Xintao Huan +3

cs.AI2026

From Text to Simulation: A Multi-Agent LLM Workflow for Automated Chemical Process Design

Xufei Tian, Wenli Du, Shaoyi Yang +4

cs.NI2024

A Near-Optimal Category Information Sampling in RFID Systems

Xiujun Wang, Zhi Liu, Xiaokang Zhou +4

physics.optics2018

Monolithic photonic circuits for Kerr frequency comb generation, filtering and modulation

Cheng Wang, Mian Zhang, Rongrong Zhu +2

cs.MM2018

DeepQoE: A unified Framework for Learning to Predict Video QoE

Huaizheng Zhang, Han Hu, Guanyu Gao +2

cs.SE2024

Chat-like Asserts Prediction with the Support of Large Language Model

Han Wang, Han Hu, Chunyang Chen +1

cs.CV2025

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

Yikun Wang, Zuyan Liu, Ziyi Wang +3

cs.CV2021

Structure-Aware Completion of Photogrammetric Meshes in Urban Road Environment

Qing Zhu, Qisen Shang, Han Hu +2

cs.CV2022

ClipCrop: Conditioned Cropping Driven by Vision-Language Model

Zhihang Zhong, Mingxi Cheng, Zhirong Wu +7

cs.LG2024

SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models

Anke Tang, Li Shen, Yong Luo +5