Publications (270)
Video Swin Transformer
Ze Liu, Jia Ning, Yue Cao +4
Gaze-Anchored Social Net: Decoding Implicit Relations via Joint Modeling
Yuqi Hou, Zhuo Chen, Han Hu +3
MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
Xinming Wang, Jian Xu, Bin Yu +9
Tutel: Adaptive Mixture-of-Experts at Scale
Changho Hwang, Wei Cui, Yifan Xiong +12
Joint Sensing, Communication, and Computation for Vertical Federated Edge Learning in Edge Perception Network
Xiaowen Cao, Dingzhu Wen, Suzhi Bi +4
Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities
Zhiwei Hao, Jianyuan Guo, Li Shen +6
Hyper-RAG: Combating LLM Hallucinations using Hypergraph-Driven Retrieval-Augmented Generation
Yifan Feng, Hao Hu, Xingliang Hou +5
Aligning Pretraining for Detection via Object-Level Contrastive Learning
Fangyun Wei, Yue Gao, Zhirong Wu +2
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
Ruihang Li, Leigang Qu, Jingxu Zhang +6
ViroBench: Benchmarking Nucleotide Foundation Models on Viral Genomics Tasks
Dongxin Ye, Fang Hu, Han Hu +6
Bamboo: LLM-Driven Discovery of API-Permission Mappings in the Android Framework
Han Hu, Wei Minn, Yonghui Liu +6
Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents
Zhengyang Tang, Yi Zhang, Chenxin Li +18
Equivariant Image Modeling
Ruixiao Dong, Mengde Xu, Zigang Geng +3
Adaptive Laplace Mechanism: Differential Privacy Preservation in Deep Learning
NhatHai Phan, Xintao Wu, Han Hu +1
LGViT: Dynamic Early Exiting for Accelerating Vision Transformer
Guanyu Xu, Jiawei Hao, Li Shen +4
Propagate Yourself: Exploring Pixel-Level Consistency for Unsupervised Visual Representation Learning
Zhenda Xie, Yutong Lin, Zheng Zhang +3
RelationNet++: Bridging Visual Representations for Object Detection via Transformer Decoder
Cheng Chi, Fangyun Wei, Han Hu
Concrete Subspace Learning based Interference Elimination for Multi-task Model Fusion
Anke Tang, Xianglin Luo, Li Shen +5
LarvSeg: Exploring Image Classification Data For Large Vocabulary Semantic Segmentation via Category-wise Attentive Classifier
Haojun Yu, Di Dai, Ziwei Zhao +3
Exploring Non-additive Randomness on ViT against Query-Based Black-Box Attacks
Jindong Gu, Fangyun Wei, Philip Torr +1
CDFKD-MFS: Collaborative Data-free Knowledge Distillation via Multi-level Feature Sharing
Zhiwei Hao, Yong Luo, Zhi Wang +2
Omni-directional attention mechanism based on Mamba for speech separation
Ke Xue, Chang Sun, Rongfei Fan +2
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
Zhiwei Hao, Jianyuan Guo, Li Shen +4
Claim-Level Rubric Rewards for Video Caption Reinforcement Learning
Mingqi Gao, Hongyuan Dong, Yifei Chen +6
Focal-RegionFace: Generating Fine-Grained Multi-attribute Descriptions for Arbitrarily Selected Face Focal Regions
Kaiwen Zheng, Junchen Fu, Songpei Xu +4
Multi-Agent Collaborative Inference via DNN Decoupling: Intermediate Feature Compression and Edge Learning
Zhiwei Hao, Guanyu Xu, Yong Luo +3
Energy-Efficient Design for IRS-Assisted MEC Networks with NOMA
Qun Wang, Fuhui Zhou, Han Hu +1
Not All Instances Contribute Equally: Instance-adaptive Class Representation Learning for Few-Shot Visual Recognition
Mengya Han, Yibing Zhan, Yong Luo +4
On Data Scaling in Masked Image Modeling
Zhenda Xie, Zheng Zhang, Yue Cao +4
DeepRS: Deep-learning Based Network-Adaptive FEC for Real-Time Video Communications
Sheng Cheng, Han Hu, Xinggong Zhang +1
Domain-knowledge Inspired Pseudo Supervision (DIPS) for Unsupervised Image-to-Image Translation Models to Support Cross-Domain Classification
Firas Al-Hindawi, Md Mahfuzur Rahman Siddiquee, Teresa Wu +2
Federated Learning with Manifold Regularization and Normalized Update Reaggregation
Xuming An, Li Shen, Han Hu +1
FedABC: Targeting Fair Competition in Personalized Federated Learning
Dui Wang, Li Shen, Yong Luo +4
Could Giant Pretrained Image Models Extract Universal Representations?
Yutong Lin, Ze Liu, Zheng Zhang +4
Relation Networks for Object Detection
Han Hu, Jiayuan Gu, Zheng Zhang +2
Breaking Shortcut: Exploring Fully Convolutional Cycle-Consistency for Video Correspondence Learning
Yansong Tang, Zhenyu Jiang, Zhenda Xie +4
Swin Transformer V2: Scaling Up Capacity and Resolution
Ze Liu, Han Hu, Yutong Lin +9
Deep Metric Transfer for Label Propagation with Limited Annotated Data
Bin Liu, Zhirong Wu, Han Hu +1
SGDA: Towards 3D Universal Pulmonary Nodule Detection via Slice Grouped Domain Attention
Rui Xu, Zhi Liu, Yong Luo +5
Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
Yifu Yuan, Yaoting Huang, Xianze Yao +20
TinyCLIP: CLIP Distillation via Affinity Mimicking and Weight Inheritance
Kan Wu, Houwen Peng, Zhenghong Zhou +10
StarCoder 2 and The Stack v2: The Next Generation
Anton Lozhkov, Raymond Li, Loubna Ben Allal +63
Negative Margin Matters: Understanding Margin in Few-shot Classification
Bin Liu, Yue Cao, Yutong Lin +4
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
Haotian Liang, Mingkang Chen, Yufei Huang +27
The paper introduces RxBrain, a foundation model that jointly reasons over language and visual inputs to create embodied plans, using a multimodal Mixture-of-Transformers architect…
Parametric Instance Classification for Unsupervised Visual Feature Learning
Yue Cao, Zhenda Xie, Bin Liu +3
Exploring Discrete Diffusion Models for Image Captioning
Zixin Zhu, Yixuan Wei, Jianfeng Wang +7
WordSup: Exploiting Word Annotations for Character based Text Detection
Han Hu, Chengquan Zhang, Yuxuan Luo +3
BCE-Net: Reliable Building Footprints Change Extraction based on Historical Map and Up-to-Date Images using Contrastive Learning
Cheng Liao, Han Hu, Xuekun Yuan +6
Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
Ziyi Wang, Xumin Yu, Yongming Rao +19
Group-Free 3D Object Detection via Transformers
Ze Liu, Zheng Zhang, Yue Cao +2
RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs
Meng-Hao Guo, Xuanyu Chu, Qianrui Yang +12
A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model
Mengde Xu, Zheng Zhang, Fangyun Wei +4
Region Rebalance for Long-Tailed Semantic Segmentation
Jiequan Cui, Yuhui Yuan, Zhisheng Zhong +4
MAP-Net: Multi Attending Path Neural Network for Building Footprint Extraction from Remote Sensed Imagery
Qing Zhu, Cheng Liao, Han Hu +2
Robustness of on-device Models: Adversarial Attack to Deep Learning Models on Android Apps
Yujin Huang, Han Hu, Chunyang Chen
Secure Semantic Communications: From Perspective of Physical Layer Security
Yongkang Li, Zheng Shi, Han Hu +3
Multi-Granularity Hand Action Detection
Ting Zhe, Jing Zhang, Yongqian Li +3
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
Jie Li, Zhixin Li, Zhi Liu +4
V-DETR: DETR with Vertex Relative Position Encoding for 3D Object Detection
Yichao Shen, Zigang Geng, Yuhui Yuan +6
Deep Fusion of Local and Non-Local Features for Precision Landslide Recognition
Qing Zhu, Lin Chen, Han Hu +3
XCMRC: Evaluating Cross-lingual Machine Reading Comprehension
Pengyuan Liu, Yuning Deng, Chenghao Zhu +1
Segment and Caption Anything
Xiaoke Huang, Jianfeng Wang, Yansong Tang +5
Energy-efficient Task Offloading for Relay Aided Mobile Edge Computing under Sequential Task Dependency
Xiangg Li, Rongfei Fan, Han Hu
PartSeg: Few-shot Part Segmentation via Part-aware Prompt Learning
Mengya Han, Heliang Zheng, Chaoyue Wang +4
Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee
Shiyuan Zuo, Jiashuo Li, Rongfei Fan +2
Enhancing GUI Exploration Coverage of Android Apps with Deep Link-Integrated Monkey
Han Hu, Han Wang, Ruiqi Dong +2
Subspace based Federated Unlearning
Guanghao Li, Li Shen, Yan Sun +3
Boosting Adversarial Transferability through Enhanced Momentum
Xiaosen Wang, Jiadong Lin, Han Hu +2
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
Terry Yue Zhuo, Minh Chien Vu, Jenny Chim +30
What Time Tells Us? An Explorative Study of Time Awareness Learned from Static Images
Dongheng Lin, Han Hu, Jianbo Jiao
Multiple View Geometry Transformers for 3D Human Pose Estimation
Ziwei Liao, Jialiang Zhu, Chunyu Wang +2
StructuredMesh: 3D Structured Optimization of Façade Components on Photogrammetric Mesh Models using Binary Integer Programming
Libin Wang, Han Hu, Qisen Shang +2
Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics
Yimin Chen, Brian Fricke, Bo Shen +10
FLSys: Toward an Open Ecosystem for Federated Learning Mobile Apps
Xiaopeng Jiang, Han Hu, Vijaya Datta Mayyuri +6
Tokenize Image as a Set
Zigang Geng, Mengde Xu, Han Hu +1
FAIL: Flow Matching Adversarial Imitation Learning for Image Generation
Yeyao Ma, Chen Li, Xiaosong Zhang +2
Federated Learning with Only Positive Labels by Exploring Label Correlations
Xuming An, Dui Wang, Li Shen +5
EfficientViT: Memory Efficient Vision Transformer with Cascaded Group Attention
Xinyu Liu, Houwen Peng, Ningxin Zheng +3
Capsule Network is Not More Robust than Convolutional Network
Jindong Gu, Volker Tresp, Han Hu
Discovering Governing Equations in the Presence of Uncertainty
Ridwan Olabiyi, Han Hu, Ashif Iquebal
Deformable ConvNets v2: More Deformable, Better Results
Xizhou Zhu, Han Hu, Stephen Lin +1
Channel Knowledge Map Construction: Recent Advances and Open Challenges
Zixiang Ren, Juncong Zhou, Jie Xu +5
Leveraging GAN Priors for Few-Shot Part Segmentation
Mengya Han, Heliang Zheng, Chaoyue Wang +3
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo +4
Joint Power Control and Data Size Selection for Over-the-Air Computation Aided Federated Learning
Xuming An, Rongfei Fan, Shiyuan Zuo +3
Mobility-Aware Offloading and Resource Allocation in MEC-Enabled IoT Networks
Han Hu, Weiwei Song, Qun Wang +2
VanillaKD: Revisit the Power of Vanilla Knowledge Distillation from Small Scale to Large Scale
Zhiwei Hao, Jianyuan Guo, Kai Han +3
DETRs with Hybrid Matching
Ding Jia, Yuhui Yuan, Haodi He +6
Semantic Image Translation for Repairing the Texture Defects of Building Models
Qisen Shang, Han Hu, Haojia Yu +3
A Computational Model for Flexoelectricity-Driven Contact Electrification
Han Hu, Xiaoying Zhuang, Timon Rabczuk
AI Generated Signal for Wireless Sensing
Hanxiang He, Han Hu, Xintao Huan +3
From Text to Simulation: A Multi-Agent LLM Workflow for Automated Chemical Process Design
Xufei Tian, Wenli Du, Shaoyi Yang +4
A Near-Optimal Category Information Sampling in RFID Systems
Xiujun Wang, Zhi Liu, Xiaokang Zhou +4
Monolithic photonic circuits for Kerr frequency comb generation, filtering and modulation
Cheng Wang, Mian Zhang, Rongrong Zhu +2
DeepQoE: A unified Framework for Learning to Predict Video QoE
Huaizheng Zhang, Han Hu, Guanyu Gao +2
Chat-like Asserts Prediction with the Support of Large Language Model
Han Wang, Han Hu, Chunyang Chen +1
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
Yikun Wang, Zuyan Liu, Ziyi Wang +3
Structure-Aware Completion of Photogrammetric Meshes in Urban Road Environment
Qing Zhu, Qisen Shang, Han Hu +2
ClipCrop: Conditioned Cropping Driven by Vision-Language Model
Zhihang Zhong, Mingxi Cheng, Zhirong Wu +7
SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models
Anke Tang, Li Shen, Yong Luo +5