papers

Publications (56)

cs.IR2025

A Survey on Multimodal Recommender Systems: Recent Advances and Future Directions

Jinfeng Xu, Zheyu Chen, Shuo Yang +5

cs.LG2013

Active Learning with Expert Advice

Peilin Zhao, Steven Hoi, Jinfeng Zhuang

cs.CV2026

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

Chen Liu, Ling Chen, Hanzhang Zhou +5

cs.CL2024

Personalised Distillation: Empowering Open-Sourced LLMs with Adaptive Learning for Code Generation

Hailin Chen, Amrita Saha, Steven Hoi +1

cs.CL2020

TOD-BERT: Pre-trained Natural Language Understanding for Task-Oriented Dialogue

Chien-Sheng Wu, Steven Hoi, Richard Socher +1

eess.IV2020

Extreme Low-Light Imaging with Multi-granulation Cooperative Networks

Keqi Wang, Peng Gao, Steven Hoi +2

cs.CV2026

D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

Dengyang Jiang, Xin Jin, Dongyang Liu +9

cs.CV2022

Distilled Siamese Networks for Visual Tracking

Jianbing Shen, Yuanpei Liu, Xingping Dong +3

cs.CV2025

UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction-as-Reasoning

Liangyu Chen, Hanzhang Zhou, Chenglin Cai +10

cs.CV2025

Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield

Dongyang Liu, Peng Gao, David Liu +8

cs.CV2026

Distribution Matching Distillation Meets Reinforcement Learning

Dengyang Jiang, Dongyang Liu, Zanyi Wang +12

cs.LG2021

CoMatch: Semi-supervised Learning with Contrastive Graph Regularization

Junnan Li, Caiming Xiong, Steven Hoi

cs.CV2026

MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction

Yisheng He, Steven Hoi

eess.IV2021

RegNet: Self-Regulated Network for Image Classification

Jing Xu, Yu Pan, Xinglin Pan +3

cs.CV2021

Detection and Rectification of Arbitrary Shaped Scene Texts by using Text Keypoints and Links

Chuhui Xue, Shijian Lu, Steven Hoi

cs.CV2026

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang +2

cs.CV2026

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Image Team, Huanqia Cai, Sihan Cao +21

cs.CL2025

Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs

Zhiyi Lyu, Jianguo Huang, Yanchen Deng +2

cs.CV2021

Align before Fuse: Vision and Language Representation Learning with Momentum Distillation

Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Deepak Gotmare +3

cs.CV2025

MAI-UI Technical Report: Real-World Centric Foundation GUI Agents

Hanzhang Zhou, Xu Zhang, Panrong Tong +8

cs.AI2023

LogAI: A Library for Log Analytics and Intelligence

Qian Cheng, Amrita Saha, Wenzhuo Yang +3

cs.LG2021

Towards Theoretically Understanding Why SGD Generalizes Better Than ADAM in Deep Learning

Pan Zhou, Jiashi Feng, Chao Ma +3

cs.CV2026

OMG-Avatar: One-shot Multi-LOD Gaussian Head Avatar

Jianqiang Ren, Lin Liu, Steven Hoi

cs.CV2026

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

Yubo Huang, Hailong Guo, Fangtai Wu +9

cs.CV2023

BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

Junnan Li, Dongxu Li, Silvio Savarese +1

cs.LG2022

Continual Normalization: Rethinking Batch Normalization for Online Continual Learning

Quang Pham, Chenghao Liu, Steven Hoi

cs.CV2021

A Theory-Driven Self-Labeling Refinement Method for Contrastive Representation Learning

Pan Zhou, Caiming Xiong, Xiao-Tong Yuan +1

cs.CV2020

Towards Noise-resistant Object Detection with Noisy Annotations

Junnan Li, Caiming Xiong, Richard Socher +1

cs.LG2024

CompeteSMoE -- Effective Training of Sparse Mixture of Experts via Competition

Quang Pham, Giang Do, Huy Nguyen +8

cs.LG2023

Learning Deep Time-index Models for Time Series Forecasting

Gerald Woo, Chenghao Liu, Doyen Sahoo +2

cs.CV2026

What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

Chen Liu, Ling Chen, Hanzhang Zhou +7

cs.CL2022

BotSIM: An End-to-End Bot Simulation Toolkit for Commercial Task-Oriented Dialog Systems

Guangsen Wang, Shafiq Joty, Junnan Li +1

cs.CV2020

Classification Calibration for Long-tail Instance Segmentation

Tao Wang, Yu Li, Bingyi Kang +5

cs.LG2023

HyperRouter: Towards Efficient Training and Inference of Sparse Mixture of Experts

Giang Do, Khiem Le, Quang Pham +7

cs.CV2018

DART: Domain-Adversarial Residual-Transfer Networks for Unsupervised Cross-Domain Image Classification

Xianghong Fang, Haoli Bai, Ziyi Guo +3

cs.CV2018

Question-Guided Hybrid Convolution for Visual Question Answering

Peng Gao, Pan Lu, Hongsheng Li +4

cs.CV2023

InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

Wenliang Dai, Junnan Li, Dongxu Li +6

cs.CL2022

BotSIM: An End-to-End Bot Simulation Framework for Commercial Task-Oriented Dialog Systems

Guangsen Wang, Samson Tan, Shafiq Joty +3

cs.LG2022

ETSformer: Exponential Smoothing Transformers for Time-series Forecasting

Gerald Woo, Chenghao Liu, Doyen Sahoo +2

cs.CV2022

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li, Caiming Xiong +1

cs.CV2026

FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head

Yingdong Hu, Yisheng He, Yiming Jiang +3

cs.CV2025

OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation

Qijun Gan, Ruizi Yang, Jianke Zhu +2

cs.CV2020

The Devil is in Classification: A Simple Framework for Long-tail Object Detection and Instance Segmentation

Tao Wang, Yu Li, Bingyi Kang +5

cs.AI2026

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

Ming Ma, Yi Zhu, Yiran Zhong +6

The paper introduces Omni-Decision, a training‑free system that keeps a structured evidence state to guide agents in gathering and validating omni‑modal information (videos, audio,…

#omni-modal question answering#evidence state management#multimodal reasoning#agentic systems
cs.CV2025

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

Fan Yang, Heyuan Li, Peihao Li +9

cs.LG2021

DualNet: Continual Learning, Fast and Slow

Quang Pham, Chenghao Liu, Steven Hoi

cs.CV2019

Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering

Gao Peng, Zhengkai Jiang, Haoxuan You +4

cs.SE2022

Detect-Localize-Repair: A Unified Framework for Learning to Debug with CodeT5

Nghi D. Q. Bui, Yue Wang, Steven Hoi

cs.CL2020

Improving Limited Labeled Dialogue State Tracking with Self-Supervision

Chien-Sheng Wu, Steven Hoi, Caiming Xiong

cs.AI2026

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Hanzhang Zhou, Panrong Tong, Xu Zhang +13

The paper introduces Qwen-UI-Agent, a foundation model for GUI agents that can operate across mobile, desktop, web, and search environments, combining GUI actions with CLI commands…

#gui agents#foundation models#mobile automation#reinforcement learning
cs.LG2022

CoST: Contrastive Learning of Disentangled Seasonal-Trend Representations for Time Series Forecasting

Gerald Woo, Chenghao Liu, Doyen Sahoo +2

cs.CL2020

Adapt-and-Adjust: Overcoming the Long-Tail Problem of Multilingual Speech Recognition

Genta Indra Winata, Guangsen Wang, Caiming Xiong +1

cs.LG2018

An Incremental Path-Following Splitting Method for Linearly Constrained Nonconvex Nonsmooth Programs

Linbo Qiao, Wei Liu, Steven Hoi

cs.CL2025

MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments

Quyu Kong, Xu Zhang, Zhenyu Yang +10

stat.ML2020

Partially Observable Online Change Detection via Smooth-Sparse Decomposition

Jie Guo, Hao Yan, Chen Zhang +1

cs.LG2021

Merlion: A Machine Learning Library for Time Series

Aadyot Bhatnagar, Paul Kassianik, Chenghao Liu +20