collaborators

5 papers

cs.CV2025

Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs

Yongyi Su, Haojie Zhang, Shijie Li +11

Multimodal large language models (MLLMs) have advanced rapidly in recent years. However, existing approaches for vision tasks often rely on indirect representations, such as genera…

cs.CV2025

Box-Level Class-Balanced Sampling for Active Object Detection

Jingyi Liao, Xun Xu, Chuan-Sheng Foo +1

Training deep object detectors demands expensive bounding box annotation. Active learning (AL) is a promising technique to alleviate the annotation burden. Performing AL at box-lev…

cs.CV2025

SODA: Out-of-Distribution Detection in Domain-Shifted Point Clouds via Neighborhood Propagation

Adam Goodge, Xun Xu, Bryan Hooi +4

As point cloud data increases in prevalence in a variety of applications, the ability to detect out-of-distribution (OOD) point cloud objects becomes critical for ensuring model sa…

cs.CV2025

Robust Distribution Alignment for Industrial Anomaly Detection under Distribution Shift

Jingyi Liao, Xun Xu, Yongyi Su +4

Anomaly detection plays a crucial role in quality control for industrial applications. However, ensuring robustness under unseen domain shifts such as lighting variations or sensor…

cs.CV2025

Multi-View Industrial Anomaly Detection with Epipolar Constrained Cross-View Fusion

Yifan Liu, Xun Xu, Shijie Li +2

Multi-camera systems provide richer contextual information for industrial anomaly detection. However, traditional methods process each view independently, disregarding the compleme…