Publications (56)
A Survey on Multimodal Recommender Systems: Recent Advances and Future Directions
Jinfeng Xu, Zheyu Chen, Shuo Yang +5
Active Learning with Expert Advice
Peilin Zhao, Steven Hoi, Jinfeng Zhuang
One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding
Chen Liu, Ling Chen, Hanzhang Zhou +5
Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation
Hailin Chen, Amrita Saha, Steven Hoi +1
TOD-BERT: Pre-trained Natural Language Understanding for Task-Oriented Dialogue
Chien-Sheng Wu, Steven Hoi, Richard Socher +1
Extreme Low-Light Imaging with Multi-granulation Cooperative Networks
Keqi Wang, Peng Gao, Steven Hoi +2
D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
Dengyang Jiang, Xin Jin, Dongyang Liu +9
Distilled Siamese Networks for Visual Tracking
Jianbing Shen, Yuanpei Liu, Xingping Dong +3
UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning
Liangyu Chen, Hanzhang Zhou, Chenglin Cai +10
Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
Dongyang Liu, Peng Gao, David Liu +8
Distribution Matching Distillation Meets Reinforcement Learning
Dengyang Jiang, Dongyang Liu, Zanyi Wang +12
CoMatch: Semi-supervised Learning with Contrastive Graph Regularization
Junnan Li, Caiming Xiong, Steven Hoi
MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction
Yisheng He, Steven Hoi
RegNet: Self-Regulated Network for Image Classification
Jing Xu, Yu Pan, Xinglin Pan +3
Detection and Rectification of Arbitrary Shaped Scene Texts by using Text Keypoints and Links
Chuhui Xue, Shijian Lu, Steven Hoi
StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring
Xiangyue Zhang, Jianfang Li, Jiaxu Zhang +2
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
Image Team, Huanqia Cai, Sihan Cao +21
Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs
Zhiyi Lyu, Jianguo Huang, Yanchen Deng +2
Align before Fuse: Vision and Language Representation Learning with Momentum Distillation
Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Deepak Gotmare +3
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
Hanzhang Zhou, Xu Zhang, Panrong Tong +8
LogAI: A Library for Log Analytics and Intelligence
Qian Cheng, Amrita Saha, Wenzhuo Yang +3
Towards Theoretically Understanding Why SGD Generalizes Better Than ADAM in Deep Learning
Pan Zhou, Jiashi Feng, Chao Ma +3
OMG-Avatar: One-shot Multi-LOD Gaussian Head Avatar
Jianqiang Ren, Lin Liu, Steven Hoi
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
Yubo Huang, Hailong Guo, Fangtai Wu +9
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
Junnan Li, Dongxu Li, Silvio Savarese +1
Continual Normalization: Rethinking Batch Normalization for Online Continual Learning
Quang Pham, Chenghao Liu, Steven Hoi
A Theory-Driven Self-Labeling Refinement Method for Contrastive Representation Learning
Pan Zhou, Caiming Xiong, Xiao-Tong Yuan +1
Towards Noise-resistant Object Detection with Noisy Annotations
Junnan Li, Caiming Xiong, Richard Socher +1
CompeteSMoE -- Effective Training of Sparse Mixture of Experts via Competition
Quang Pham, Giang Do, Huy Nguyen +8
Learning Deep Time-index Models for Time Series Forecasting
Gerald Woo, Chenghao Liu, Doyen Sahoo +2
What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States
Chen Liu, Ling Chen, Hanzhang Zhou +7
BotSIM: An End-to-End Bot Simulation Toolkit for Commercial Task-Oriented Dialog Systems
Guangsen Wang, Shafiq Joty, Junnan Li +1
Classification Calibration for Long-tail Instance Segmentation
Tao Wang, Yu Li, Bingyi Kang +5
HyperRouter: Towards Efficient Training and Inference of Sparse Mixture of Experts
Giang Do, Khiem Le, Quang Pham +7
DART: Domain-Adversarial Residual-Transfer Networks for Unsupervised Cross-Domain Image Classification
Xianghong Fang, Haoli Bai, Ziyi Guo +3
Question-Guided Hybrid Convolution for Visual Question Answering
Peng Gao, Pan Lu, Hongsheng Li +4
InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning
Wenliang Dai, Junnan Li, Dongxu Li +6
BotSIM: An End-to-End Bot Simulation Framework for Commercial Task-Oriented Dialog Systems
Guangsen Wang, Samson Tan, Shafiq Joty +3
ETSformer: Exponential Smoothing Transformers for Time-series Forecasting
Gerald Woo, Chenghao Liu, Doyen Sahoo +2
BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
Junnan Li, Dongxu Li, Caiming Xiong +1
FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head
Yingdong Hu, Yisheng He, Yiming Jiang +3
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
Qijun Gan, Ruizi Yang, Jianke Zhu +2
The Devil is in Classification: A Simple Framework for Long-tail Object Detection and Instance Segmentation
Tao Wang, Yu Li, Bingyi Kang +5
Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA
Ming Ma, Yi Zhu, Yiran Zhong +6
The paper introduces Omni-Decision, a training‑free system that keeps a structured evidence state to guide agents in gathering and validating omni‑modal information (videos, audio,…
ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation
Fan Yang, Heyuan Li, Peihao Li +9
DualNet: Continual Learning, Fast and Slow
Quang Pham, Chenghao Liu, Steven Hoi
Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering
Gao Peng, Zhengkai Jiang, Haoxuan You +4
Detect-Localize-Repair: A Unified Framework for Learning to Debug with CodeT5
Nghi D. Q. Bui, Yue Wang, Steven Hoi
Improving Limited Labeled Dialogue State Tracking with Self-Supervision
Chien-Sheng Wu, Steven Hoi, Caiming Xiong
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Hanzhang Zhou, Panrong Tong, Xu Zhang +13
The paper introduces Qwen-UI-Agent, a foundation model for GUI agents that can operate across mobile, desktop, web, and search environments, combining GUI actions with CLI commands…
CoST: Contrastive Learning of Disentangled Seasonal-Trend Representations for Time Series Forecasting
Gerald Woo, Chenghao Liu, Doyen Sahoo +2
Adapt-and-Adjust: Overcoming the Long-Tail Problem of Multilingual Speech Recognition
Genta Indra Winata, Guangsen Wang, Caiming Xiong +1
An Incremental Path-Following Splitting Method for Linearly Constrained Nonconvex Nonsmooth Programs
Linbo Qiao, Wei Liu, Steven Hoi
MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
Quyu Kong, Xu Zhang, Zhenyu Yang +10
Partially Observable Online Change Detection via Smooth-Sparse Decomposition
Jie Guo, Hao Yan, Chen Zhang +1
Merlion: A Machine Learning Library for Time Series
Aadyot Bhatnagar, Paul Kassianik, Chenghao Liu +20