Publications (403)
EnAET: A Self-Trained framework for Semi-Supervised and Supervised Learning with Ensemble Transformations
Xiao Wang, Daisuke Kihara, Jiebo Luo +1
MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text
Junchen Zhu, Huan Yang, Wenjing Wang +8
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
Bin Lin, Zhenyu Tang, Yang Ye +7
CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios
Jingyang Lin, Yingda Xia, Jianpeng Zhang +5
Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization
Songyang Zhang, Houwen Peng, Le Yang +2
Patch Transformer for Multi-tagging Whole Slide Histopathology Images
Weijian Li, Viet-Duy Nguyen, Haofu Liao +3
User-Curated Image Collections: Modeling and Recommendation
Yuncheng Li, Yang Cong, Tao Mei +1
Semantic Layout Manipulation with High-Resolution Sparse Attention
Haitian Zheng, Zhe Lin, Jingwan Lu +4
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
Haoyu Huang, Jinfa Huang, Zhongwei Wan +3
ArtFlow: Unbiased Image Style Transfer via Reversible Neural Flows
Jie An, Siyu Huang, Yibing Song +3
Image Sentiment Transfer
Tianlang Chen, Wei Xiong, Haitian Zheng +1
ICDAR 2023 Competition on Structured Text Extraction from Visually-Rich Document Images
Wenwen Yu, Chengquan Zhang, Haoyu Cao +24
Slender Object Detection: Diagnoses and Improvements
Zhaoyi Wan, Yimin Chen, Sutao Deng +3
Breast Cancer Induced Bone Osteolysis Prediction Using Temporal Variational Auto-Encoders
Wei Xiong, Neil Yeung, Shubo Wang +3
Understanding Illicit Drug Use Behaviors by Mining Social Media
Yiheng Zhou, Numair Sani, Chia-Kuei Lee +1
Deciphering the 2016 U.S. Presidential Campaign in the Twitter Sphere: A Comparison of the Trumpists and Clintonists
Yu Wang, Yuncheng Li, Jiebo Luo
Will Sanders Supporters Jump Ship for Trump? Fine-grained Analysis of Twitter Followers
Yu Wang, Yang Feng, Xiyang Zhang +2
More Knowledge is Better: Cross-Modality Volume Completion and 3D+2D Segmentation for Intracardiac Echocardiography Contouring
Haofu Liao, Yucheng Tang, Gareth Funka-Lea +2
Harnessing GPT-4V(ision) for Insurance: A Preliminary Exploration
Chenwei Lin, Hanjia Lyu, Jiebo Luo +1
XraySyn: Realistic View Synthesis From a Single Radiograph Through CT Priors
Cheng Peng, Haofu Liao, Gina Wong +3
Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph
Wentian Zhao, Yao Hu, Heda Wang +2
ElectionSim: Massive Population Election Simulation Powered by Large Language Model Driven Agents
Xinnong Zhang, Jiayu Lin, Libo Sun +10
DOTA: A Large-scale Dataset for Object Detection in Aerial Images
Gui-Song Xia, Xiang Bai, Jian Ding +6
Look behind the Censorship: Reposting-User Characterization and Muted-Topic Restoration
Yichi Qian, Qiyi Shan, Hanjia Lyu +1
On Vocabulary Reliance in Scene Text Recognition
Zhaoyi Wan, Jielei Zhang, Liang Zhang +2
American Twitter Users Revealed Social Determinants-related Oral Health Disparities amid the COVID-19 Pandemic
Yangxin Fan, Hanjia Lyu, Jin Xiao +1
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
Yongdong Luo, Wang Chen, Xiawu Zheng +8
Contextual Modeling for 3D Dense Captioning on Point Clouds
Yufeng Zhong, Long Xu, Jiebo Luo +1
MANet: Improving Video Denoising with a Multi-Alignment Network
Yaping Zhao, Haitian Zheng, Zhongrui Wang +2
Adaptive Recursive Circle Framework for Fine-grained Action Recognition
Hanxi Lin, Xinxiao Wu, Jiebo Luo
Domain-Scalable Unpaired Image Translation via Latent Space Anchoring
Siyu Huang, Jie An, Donglai Wei +3
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
Ziyun Zeng, Hang Hua, Bocheng Zou +3
Large-Scale Sleep Condition Analysis Using Selfies from Social Media
Xuefeng Peng, Jiebo Luo, Catherine Glenn +2
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
Yongdong Luo, Xiawu Zheng, Guilin Li +8
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
Yunlong Tang, Jing Bi, Chao Huang +16
Spatio-temporal Video Re-localization by Warp LSTM
Yang Feng, Lin Ma, Wei Liu +1
Tracking Illicit Drug Dealing and Abuse on Instagram using Multimodal Analysis
Xitong Yang, Jiebo Luo
Understanding Political Polarization via Jointly Modeling Users, Connections and Multimodal Contents on Heterogeneous Graphs
Hanjia Lyu, Jiebo Luo
Detection and Analysis of 2016 US Presidential Election Related Rumors on Twitter
Zhiwei Jin, Juan Cao, Han Guo +3
PixelDiT: Pixel Diffusion Transformers for Image Generation
Yongsheng Yu, Wei Xiong, Weili Nie +3
Localized Adversarial Domain Generalization
Wei Zhu, Le Lu, Jing Xiao +3
End-to-end Multi-Modal Multi-Task Vehicle Control for Self-Driving Cars with Visual Perception
Zhengyuan Yang, Yixuan Zhang, Jerry Yu +2
Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation
Qing Xu, Xiangjian He, Wenting Duan +2
Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training
Zhenghong Zhou, Jie An, Jiebo Luo
Who are the Devils Wearing Prada in New York City?
KuanTing Chen, Kezhen Chen, Peizhong Cong +2
GPT-4V(ision) as A Social Media Analysis Engine
Hanjia Lyu, Jinfa Huang, Daoan Zhang +6
How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
Zhen Chen, Qing Xu, Jinlin Wu +7
Fine-grained Mining of Illicit Drug Use Patterns Using Social Multimedia Data from Instagram
Yiheng Zhou, Numair Sani, Jiebo Luo
VisualActBench: Can VLMs See and Act like a Human?
Daoan Zhang, Pai Liu, Xiaofei Zhou +6
From Static to Dynamic Prediction: Wildfire Risk Assessment Based on Multiple Environmental Factors
Tanqiu Jiang, Sidhant K. Bendre, Hanjia Lyu +1
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
Zhikai Chen, Fuchen Long, Zhaofan Qiu +4
Multi-Scale 2D Temporal Adjacent Networks for Moment Localization with Natural Language
Songyang Zhang, Houwen Peng, Jianlong Fu +2
Image Captioning at Will: A Versatile Scheme for Effectively Injecting Sentiments into Image Descriptions
Quanzeng You, Hailin Jin, Jiebo Luo
Multi-Modulation Network for Audio-Visual Event Localization
Hao Wang, Zheng-Jun Zha, Liang Li +2
The Effect of Pets on Happiness: A Data-Driven Approach via Large-Scale Social Media
Yuchen Wu, Jianbo Yuan, Quanzeng You +1
Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation
Ziyang Song, Zelin Zang, Zuyao Chen +6
Cross-modal Contrastive Distillation for Instructional Activity Anticipation
Zhengyuan Yang, Jingen Liu, Jing Huang +4
INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance
Chenwei Lin, Hanjia Lyu, Xian Xu +1
Holistic Visual-Textual Sentiment Analysis with Prior Models
Junyu Chen, Jie An, Hanjia Lyu +2
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
Shuhang Lin, Wenyue Hua, Lingyao Li +7
Cultural Diffusion and Trends in Facebook Photographs
Quanzeng You, DarÃo GarcÃa-GarcÃa, Mahohar Paluri +2
OpenLEAF: Open-Domain Interleaved Image-Text Generation and Evaluation
Jie An, Zhengyuan Yang, Linjie Li +5
Image Captioning with Semantic Attention
Quanzeng You, Hailin Jin, Zhaowen Wang +2
VizWiz Grand Challenge: Answering Visual Questions from Blind People
Danna Gurari, Qing Li, Abigale J. Stangl +5
CellScientist: Dual-Space Hierarchical Orchestration for Closed-Loop Refinement of Virtual Cell Models
Mengran Li, Bo Li, Jiaying Wang +12
StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing
Han Wang, Deyi Ji, Lanyun Zhu +2
Doctors vs. Nurses: Understanding the Great Divide in Vaccine Hesitancy among Healthcare Workers
Sajid Hussain Rafi Ahamed, Shahid Shakil, Hanjia Lyu +2
Measuring Female Representation and Impact in Films over Time
Luoying Yang, Zhou Xu, Jiebo Luo
PromptCap: Prompt-Guided Task-Aware Image Captioning
Yushi Hu, Hang Hua, Zhengyuan Yang +3
Music Sentiment Transfer
Miles Sigel, Michael Zhou, Jiebo Luo
Progressive Self-Supervised Attention Learning for Aspect-Level Sentiment Analysis
Jialong Tang, Ziyao Lu, Jinsong Su +4
Relational Reasoning using Prior Knowledge for Visual Captioning
Jingyi Hou, Xinxiao Wu, Yayun Qi +3
Text-Driven Causal Representation Learning for Source-Free Domain Generalization
Lihua Zhou, Mao Ye, Nianxin Li +7
Taking sides: Public Opinion over the Israel-Palestine Conflict in 2021
Arsal Imtiaz, Danish Khan, Hanjia Lyu +1
Exploiting Temporal Relationships in Video Moment Localization with Natural Language
Songyang Zhang, Jinsong Su, Jiebo Luo
Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
Jingyang Lin, Andy Wong, Tian Xia +4
State-level Racially Motivated Hate Crimes Contrast Public Opinion on the #StopAsianHate and #StopAAPIHate Movement
Hanjia Lyu, Yangxin Fan, Ziyu Xiong +2
From Selection to Generation: A Survey of LLM-based Active Learning
Yu Xia, Subhojyoti Mukherjee, Zhouhang Xie +31
Skin Disease Classification versus Skin Lesion Characterization: Achieving Robust Diagnosis using Multi-label Deep Neural Networks
Haofu Liao, Yuncheng Li, Jiebo Luo
Face Off: Polarized Public Opinions on Personal Face Mask Usage during the COVID-19 Pandemic
Neil Yeung, Jonathan Lai, Jiebo Luo
Structured Landmark Detection via Topology-Adapting Deep Graph Learning
Weijian Li, Yuhang Lu, Kang Zheng +8
Tactics and Tallies: Inferring Voter Preferences in the 2016 U.S. Presidential Primaries Using Sparse Learning
Yu Wang, Yang Feng, Xiyang Zhang +1
LibContinual: A Comprehensive Library towards Realistic Continual Learning
Wenbin Li, Shangge Liu, Borui Kang +7
Automatic Radiology Report Generation based on Multi-view Image Fusion and Medical Concept Enrichment
Jianbo Yuan, Haofu Liao, Rui Luo +1
A Multilayer Framework for Online Metric Learning
Wenbin Li, Yanfang Liu, Jing Huo +4
Tactics and Tallies: A Study of the 2016 U.S. Presidential Campaign Using Twitter 'Likes'
Yu Wang, Xiyang Zhang, Jiebo Luo
Grounding-Tracking-Integration
Zhengyuan Yang, Tushar Kumar, Tianlang Chen +2
Attentive Relational Networks for Mapping Images to Scene Graphs
Mengshi Qi, Weijian Li, Zhengyuan Yang +2
Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation
Jie An, Songyang Zhang, Harry Yang +4
What Kind of Person Wins the Turing Award?
Zhongkai Shangguan, Zihe Zheng, Jiebo Luo
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
Yongsheng Yu, Jiebo Luo
ADN: Artifact Disentanglement Network for Unsupervised Metal Artifact Reduction
Haofu Liao, Wei-An Lin, S. Kevin Zhou +1
Understanding the Hoarding Behaviors during the COVID-19 Pandemic using Large Scale Social Media Data
Xupin Zhang, Hanjia Lyu, Jiebo Luo
Learning Deep Bilinear Transformation for Fine-grained Image Representation
Heliang Zheng, Jianlong Fu, Zheng-Jun Zha +1
Personalized Multimodal Large Language Models: A Survey
Junda Wu, Hanjia Lyu, Yu Xia +24
Improving Pairwise Ranking for Multi-label Image Classification
Yuncheng Li, Yale Song, Jiebo Luo
Pinterest Board Recommendation for Twitter Users
Xitong Yang, Yuncheng Li, Jiebo Luo
The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design
Zelin Zang, Yuhang Song, Aili Wang +6
Characterizing Bias: Benchmarking Large Language Models in Simplified versus Traditional Chinese
Hanjia Lyu, Jiebo Luo, Jian Kang +1
Using Social Media to Promote STEM Education: Matching College Students with Role Models
Ling He, Lee Murphy, Jiebo Luo