Publications (430)
Matching-CNN Meets KNN: Quasi-Parametric Human Parsing
Si Liu, Xiaodan Liang, Luoqi Liu +6
DDP-WM: Disentangled Dynamics Prediction for Efficient World Models
Shicheng Yin, Kaixuan Yin, Weixing Chen +3
Physical-Virtual Collaboration Modeling for Intra-and Inter-Station Metro Ridership Prediction
Lingbo Liu, Jingwen Chen, Hefeng Wu +3
AIM 2020 Challenge on Real Image Super-Resolution: Methods and Results
Pengxu Wei, Hannan Lu, Radu Timofte +68
Knowledge-Guided Recurrent Neural Network Learning for Task-Oriented Action Prediction
Liang Lin, Lili Huang, Tianshui Chen +2
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
Yibo Zhang, Liang Lin, Kaiwen Luo +8
Hierarchical Scene Parsing by Weakly Supervised Learning with Image Descriptions
Ruimao Zhang, Liang Lin, Guangrun Wang +2
ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow
Shanshan Guo, Xiwen Liang, Junfan Lin +3
Open-World Pose Transfer via Sequential Test-Time Adaption
Junyang Chen, Xiaoyu Xian, Zhijing Yang +5
Deep Boosting: Joint Feature Selection and Analysis Dictionary Learning in Hierarchy
Zhanglin Peng, Ya Li, Zhaoquan Cai +1
Re-Densification Meets Cross-Scale Propagation: Real-Time Neural Compression of LiDAR Point Clouds
Pengpeng Yu, Haoran Li, Runqing Jiang +3
Weakly-Supervised Spatio-Temporal Anomaly Detection in Surveillance Video
Jie Wu, Wei Zhang, Guanbin Li +5
Explore before Moving: A Feasible Path Estimation and Memory Recalling Framework for Embodied Navigation
Yang Wu, Shirui Feng, Guanbin Li +1
Dual Adversarial Adaptation for Cross-Device Real-World Image Super-Resolution
Xiaoqian Xu, Pengxu Wei, Weikai Chen +3
Image Comes Dancing with Collaborative Parsing-Flow Video Synthesis
Bowen Wu, Zhenyu Xie, Xiaodan Liang +3
DNA Family: Boosting Weight-Sharing NAS with Block-Wise Supervisions
Guangrun Wang, Changlin Li, Liuchun Yuan +5
Incorporating Structural Alternatives and Sharing into Hierarchy for Multiclass Object Recognition and Detection
Xiaolong Wang, Liang Lin, Lichao Huang +1
PIRM Challenge on Perceptual Image Enhancement on Smartphones: Report
Andrey Ignatov, Radu Timofte, Thang Van Vu +45
HyCoRec: Hypergraph-Enhanced Multi-Preference Learning for Alleviating Matthew Effect in Conversational Recommendation
Yongsen Zheng, Ruilin Xu, Ziliang Chen +4
Towards Human-Machine Cooperation: Self-supervised Sample Mining for Object Detection
Keze Wang, Xiaopeng Yan, Dongyu Zhang +2
Adaptive Scene Category Discovery with Generative Learning and Compositional Sampling
Liang Lin, Ruimao Zhang, Xiaohua Duan
ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
Weiqi Li, Zehao Zhang, Liang Lin +1
SafeLoad: Efficient Admission Control Framework for Identifying Memory-Overloading Queries in Cloud Data Warehouses
Yifan Wu, Yuhan Li, Zhenhua Wang +8
Broadband Near-Infrared Compressive Spectral Imaging System with Reflective Structure
Yutong Li, Zhenming Yu, Liming Cheng +7
LAW-Diffusion: Complex Scene Generation by Diffusion with Layouts
Binbin Yang, Yi Luo, Ziliang Chen +3
Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention into Convolutions
ZiYi Dong, Chengxing Zhou, Weijian Deng +3
In-Situ Tweedie Discrete Diffusion Models
Xiao Li, Jiaqi Zhang, Shuxiang Zhang +3
UniErase: Towards Balanced and Precise Unlearning in Language Models
Miao Yu, Liang Lin, Guibin Zhang +7
Unconstrained Facial Landmark Localization with Backbone-Branches Fully-Convolutional Networks
Zhujin Liang, Shengyong Ding, Liang Lin
OrthAlign: Orthogonal Subspace Decomposition for Non-Interfering Multi-Objective Alignment
Liang Lin, Zhihao Xu, Junhao Dong +10
Stable Language Guidance for Vision-Language-Action Models
Zhihao Zhan, Yuhao Chen, Jiaying Zhou +5
Fashion Retrieval via Graph Reasoning Networks on a Similarity Pyramid
Zhanghui Kuang, Yiming Gao, Guanbin Li +4
Enhancing Prototypical Few-Shot Learning by Leveraging the Local-Level Strategy
Junying Huang, Fan Chen, Keze Wang +2
One-shot Face Sketch Synthesis in the Wild via Generative Diffusion Prior and Instruction Tuning
Han Wu, Junyao Li, Kangbo Zhao +3
A Generic Shared Attention Mechanism for Various Backbone Neural Networks
Zhongzhan Huang, Senwei Liang, Mingfu Liang +1
Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video
Qing Zhao, Weijian Deng, Pengxu Wei +1
Quantifying In-Context Reasoning Effects and Memorization Effects in LLMs
Siyu Lou, Yuntian Chen, Xiaodan Liang +2
Towards Real-World Burst Image Super-Resolution: Benchmark and Method
Pengxu Wei, Yujing Sun, Xingbei Guo +4
Learning to Segment Human by Watching YouTube
Xiaodan Liang, Yunchao Wei, Liang Lin +4
Deep Human Parsing with Active Template Regression
Xiaodan Liang, Si Liu, Xiaohui Shen +5
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
Weizhi Zhong, Junfan Lin, Peixin Chen +2
Long-term Wind Power Forecasting with Hierarchical Spatial-Temporal Transformer
Yang Zhang, Lingbo Liu, Xinyu Xiong +3
Semantics-aware Adaptive Knowledge Distillation for Sensor-to-Vision Action Recognition
Yang Liu, Keze Wang, Guanbin Li +1
Learning Latent Spatio-Temporal Compositional Model for Human Action Recognition
Xiaodan Liang, Liang Lin, Liangliang Cao
A Near-Optimal Gradient Flow for Learning Neural Energy-Based Models
Yang Wu, Pengxu Wei, Liang Lin
Knowledge-Routed Visual Question Reasoning: Challenges for Deep Representation Embedding
Qingxing Cao, Bailin Li, Xiaodan Liang +2
Computational Baby Learning
Xiaodan Liang, Si Liu, Yunchao Wei +3
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
Jiaying Zhou, Zhihao Zhan, Ruifeng Zhai +5
AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?
Liang Lin, Feng Xiong, Zengbin Wang +5
Knowledge Graph Transfer Network for Few-Shot Recognition
Riquan Chen, Tianshui Chen, Xiaolu Hui +3
SkiP: When to Skip and When to Refine for Efficient Robot Manipulation
Mingtong Dai, Guanqi Peng, Yongjie Bai +5
Attentive Crowd Flow Machines
Lingbo Liu, Ruimao Zhang, Jiefeng Peng +3
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
Weijia Liufu, Xiaoyu Guo, Ruiyi Chen +16
SEE: Signal Embedding Energy for Quantifying Noise Interference in Large Audio Language Models
Yuanhe Zhang, Jiayu Tian, Yibo Zhang +5
Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space
ZiYi Dong, Yuliang Huang, Weijian Deng +3
Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models
Guoming Ling, Zhongzhan Huang, Yupei Lin +4
Progressively Diffused Networks for Semantic Image Segmentation
Ruimao Zhang, Wei Yang, Zhanglin Peng +2
DenseLight: Efficient Control for Large-scale Traffic Signals with Dense Feedback
Junfan Lin, Yuying Zhu, Lingbo Liu +3
Zoom and Learn: Generalizing Deep Stereo Matching to Novel Domains
Jiahao Pang, Wenxiu Sun, Chengxi Yang +4
Efficient Crowd Counting via Structured Knowledge Transfer
Lingbo Liu, Jiaqi Chen, Hefeng Wu +3
One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion
Jinxi Liu, Zijian He, Guangrun Wang +2
Robust Egocentric Referring Video Object Segmentation via Dual-Modal Causal Intervention
Haijing Liu, Zhiyuan Song, Hefeng Wu +3
Layout-Graph Reasoning for Fashion Landmark Detection
Weijiang Yu, Xiaodan Liang, Ke Gong +3
SkeletonMAE: Graph-based Masked Autoencoder for Skeleton Sequence Pre-training
Hong Yan, Yang Liu, Yushen Wei +3
AdaMorph: Unified Motion Retargeting via Embodiment-Aware Adaptive Transformers
Haoyu Zhang, Shibo Jin, Lusong Li +4
PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models
Zhisheng Chen, Tingyu Wu, Zijie Zhou +7
Two-Phase Dynamics of Interactions Explains the Starting Point of a DNN Learning Over-Fitted Features
Junpeng Zhang, Qing Li, Liang Lin +1
Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning
Weifeng Chen, Yatai Ji, Jie Wu +6
AttNS: Attention-Inspired Numerical Solving For Limited Data Scenarios
Zhongzhan Huang, Mingfu Liang, Shanshan Zhong +1
Reinforcement Learning for Weakly Supervised Temporal Grounding of Natural Language in Untrimmed Videos
Jie Wu, Guanbin Li, Xiaoguang Han +1
Heterogeneous Semantic Transfer for Multi-label Recognition with Partial Labels
Tianshui Chen, Tao Pu, Lingbo Liu +3
Continual Object Detection via Prototypical Task Correlation Guided Gating Mechanism
Binbin Yang, Xinchi Deng, Han Shi +6
RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models
Jingzhou Luo, Yifan Wen, Yongjie Bai +3
DDet: Dual-path Dynamic Enhancement Network for Real-World Image Super-Resolution
Yukai Shi, Haoyu Zhong, Zhijing Yang +2
Proposal-free Network for Instance-level Object Segmentation
Xiaodan Liang, Yunchao Wei, Xiaohui Shen +3
Active Self-Paced Learning for Cost-Effective and Progressive Face Identification
Liang Lin, Keze Wang, Deyu Meng +2
Is Faster R-CNN Doing Well for Pedestrian Detection?
Liliang Zhang, Liang Lin, Xiaodan Liang +1
Fitting Unknown Number of Hyperplanes with Manifold Optimization
Zhiqin Cheng, Yu Zhan, Mingjin Zhang +2
MEIA: Multimodal Embodied Perception and Interaction in Unknown Environments
Yang Liu, Xinshuai Song, Kaixuan Jiang +4
Learning to Segment Object Candidates via Recursive Neural Networks
Tianshui Chen, Liang Lin, Xian Wu +2
SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
Huahui Yi, Kun Wang, Qiankun Li +7
Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation
Zijian Song, Qichang Li, Sihan Qin +4
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
Yang Liu, Weixing Chen, Yongjie Bai +4
SIRST-5K: Exploring Massive Negatives Synthesis with Self-supervised Learning for Robust Infrared Small Target Detection
Yahao Lu, Yupei Lin, Han Wu +3
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
Baoshun Tong, Haoran He, Ling Pan +2
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
Zhongzhan Huang, Guoming Ling, Yupei Lin +4
Towards Sample-Efficiency and Generalization of Transfer and Inverse Reinforcement Learning: A Comprehensive Literature Review
Hossein Hassani, Ehsan Hallaji, Roozbeh Razavi-Far +2
Thinking Before You Speak: A Proactive Test-time Scaling Approach
Cong Liu, Wenchang Chai, Hejun Wu +3
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
Liang Lin, Miao Yu, Kaiwen Luo +9
GTAE: Graph-Transformer based Auto-Encoders for Linguistic-Constrained Text Style Transfer
Yukai Shi, Sen Zhang, Chenxing Zhou +3
Multi-object Video Generation from Single Frame Layouts
Yang Wu, Zhibin Liu, Hefeng Wu +1
FRAME Revisited: An Interpretation View Based on Particle Evolution
Xu Cai, Yang Wu, Guanbin Li +2
On Fast Simulation of Dynamical System with Neural Vector Enhanced Numerical Solver
Zhongzhan Huang, Senwei Liang, Hong Zhang +2
LSTM Pose Machines
Yue Luo, Jimmy Ren, Zhouxia Wang +5
Recurrent 3D Pose Sequence Machines
Mude Lin, Liang Lin, Xiaodan Liang +2
Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
Zijian Song, Sihan Qin, Tianshui Chen +2
InfiniteWorld: A Unified Scalable Simulation Framework for General Visual-Language Robot Interaction
Pengzhen Ren, Min Li, Zhen Luo +15
Diff-Mosaic: Augmenting Realistic Representations in Infrared Small Target Detection via Diffusion Prior
Yukai Shi, Yupei Lin, Pengxu Wei +3
VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling
Weiqi Li, Quande Zhang, Ruifeng Zhai +2
Towards a solid solution of real-time fire and flame detection
Bo Jiang, Yongyi Lu, Xiying Li +1