Publications (277)
ConText: Driving In-context Learning for Text Removal and Segmentation
Fei Zhang, Pei Zhang, Baosong Yang +3
Reprogramming Distillation for Medical Foundation Models
Yuhang Zhou, Siyuan Du, Haolin Li +3
Exploring Effective Mask Sampling Modeling for Neural Image Compression
Lin Liu, Mingming Zhao, Shanxin Yuan +5
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
Ruipeng Zhang, Ziqing Fan, Jiangchao Yao +2
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
Zeqian Li, Shangzhe Di, Zhonghua Zhai +3
RARE: Retrieval-Augmented Reasoning Modeling
Zhengren Wang, Jiayang Yu, Dongsheng Ma +8
Advancing Myopia To Holism: Fully Contrastive Language-Image Pre-training
Haicheng Wang, Chen Ju, Weixiong Lin +9
ReMamber: Referring Image Segmentation with Mamba Twister
Yuhuan Yang, Chaofan Ma, Jiangchao Yao +3
Improving Human Image Animation via Semantic Representation Alignment
Chang Liu, Mengting Chen, Yixuan Huang +5
AgentEHR: Advancing Autonomous Clinical Decision-Making via Retrospective Summarization
Yusheng Liao, Chuan Xuan, Yutong Cai +4
Cooperative Learning for Noisy Supervision
Hao Wu, Jiangchao Yao, Ya Zhang +1
Active Sampling for Node Attribute Completion on Graphs
Benyuan Liu, Xu Chen, Yanfeng Wang +3
SciMaster: Towards General-Purpose Scientific AI Agents, Part I. X-Master as Foundation: Can We Lead on Humanity's Last Exam?
Jingyi Chai, Shuo Tang, Rui Ye +8
POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management
Yikun Liu, Yuan Liu, Le Tian +6
RadIR: A Scalable Framework for Multi-Grained Medical Image Retrieval via Radiology Report Mining
Tengfei Zhang, Ziheng Zhao, Chaoyi Wu +4
UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification
Tianjie Dai, Ruipeng Zhang, Feng Hong +3
Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic Segmentation
Fei Zhang, Tianfei Zhou, Boyang Li +6
When Seeing Is not Enough: Revealing the Limits of Active Reasoning in MLLMs
Hongcheng Liu, Pingjie Wang, Yuhao Wang +3
Reconstruct the Pruned Model without Any Retraining
Pingjie Wang, Ziqing Fan, Shengchao Hu +3
MS-KD: Multi-Organ Segmentation with Multiple Binary-Labeled Datasets
Shixiang Feng, Yuhang Zhou, Xiaoman Zhang +2
GenTac: Generative Modeling and Forecasting of Soccer Tactics
Jiayuan Rao, Tianlin Gui, Haoning Wu +2
Iteratively-Refined Interactive 3D Medical Image Segmentation with Multi-Agent Reinforcement Learning
Xuan Liao, Wenhao Li, Qisen Xu +5
PMC-CLIP: Contrastive Language-Image Pre-training using Biomedical Documents
Weixiong Lin, Ziheng Zhao, Xiaoman Zhang +4
FedSkip: Combatting Statistical Heterogeneity with Federated Skip Aggregation
Ziqing Fan, Yanfeng Wang, Jiangchao Yao +3
Combating Representation Learning Disparity with Geometric Harmonization
Zhihan Zhou, Jiangchao Yao, Feng Hong +3
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
Shuyang Jiang, Yuhao Wang, Ya Zhang +2
Distilling Vision-Language Pre-training to Collaborate with Weakly-Supervised Temporal Action Localization
Chen Ju, Kunhao Zheng, Jinxiang Liu +5
Few-Shot Anomaly Detection via Category-Agnostic Registration Learning
Chaoqin Huang, Haoyan Guan, Aofan Jiang +4
Multi-Modal Prototypes for Open-World Semantic Segmentation
Yuhuan Yang, Chaofan Ma, Chen Ju +4
Audio-Visual Segmentation via Unlabeled Frame Exploitation
Jinxiang Liu, Yikun Liu, Fei Zhang +3
Low-Light Video Enhancement with Synthetic Event Guidance
Lin Liu, Junfeng An, Jianzhuang Liu +6
Demographic-Aware Self-Supervised Anomaly Detection Pretraining for Equitable Rare Cardiac Diagnosis
Chaoqin Huang, Zi Zeng, Aofan Jiang +6
MedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models
Yan Cai, Linlin Wang, Ye Wang +4
Contrastive Learning with Boosted Memorization
Zhihan Zhou, Jiangchao Yao, Yanfeng Wang +2
Redundancy-Adaptive Multimodal Learning for Imperfect Data
Mengxi Chen, Jiangchao Yao, Linyu Xing +3
HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks
Zhe Chen, Yusheng Liao, Zhiyuan Zhu +4
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
Haolin Li, Yuhang Zhou, Ziheng Zhao +5
Decoding Linguistic Representations of Human Brain
Yu Wang, Heyang Liu, Yuhao Wang +6
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
Wenhao Wang, Peizhi Niu, Gongyi Zou +9
TBP-Former: Learning Temporal Bird's-Eye-View Pyramid for Joint Perception and Prediction in Vision-Centric Autonomous Driving
Shaoheng Fang, Zi Wang, Yiqi Zhong +3
Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
Zichen Wen, Boxue Yang, Shuang Chen +30
MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning
Haoning Wu, Shaocheng Shen, Qiang Hu +3
Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs
Feng Hong, Geng Yu, Yushi Ye +5
COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking
Chunhui Zhang, Li Liu, Jialin Gao +5
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
Xiaoman Zhang, Chaoyi Wu, Ziheng Zhao +4
Q-value Regularized Transformer for Offline Reinforcement Learning
Shengchao Hu, Ziqing Fan, Chaoqin Huang +4
DiffusionSeg: Adapting Diffusion Towards Unsupervised Object Discovery
Chaofan Ma, Yuhuan Yang, Chen Ju +5
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
Xianghe Pang, Shuo Tang, Rui Ye +4
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
Zhenyang Ni, Rui Ye, Yuxi Wei +3
Deep Hashing with Triplet Quantization Loss
Yuefu Zhou, Shanshan Huang, Ya Zhang +1
Self-Localized Collaborative Perception
Zhenyang Ni, Zixing Lei, Yifan Lu +4
ChoreoNet: Towards Music to Dance Synthesis with Choreographic Action Unit
Zijie Ye, Haozhe Wu, Jia Jia +4
SoccerNet 2026 Challenges Results
Anthony Cioppa, Silvio Giancola, Håkan Ardö +102
Towards an End-to-End Framework for Invasive Brain Signal Decoding with Large Language Models
Sheng Feng, Heyang Liu, Yu Wang +1
WanJuanSiLu: A High-Quality Open-Source Webtext Dataset for Low-Resource Languages
Jia Yu, Fei Yuan, Rui Min +20
Ethical-Lens: Curbing Malicious Usages of Open-Source Text-to-Image Models
Yuzhu Cai, Sheng Yin, Yuxi Wei +5
Multi-Agent System for Comprehensive Soccer Understanding
Jiayuan Rao, Zifeng Li, Haoning Wu +3
Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis
Chaoyi Wu, Jiayu Lei, Qiaoyu Zheng +8
Dual-granularity Sinkhorn Distillation for Enhanced Learning from Long-tailed Noisy Data
Feng Hong, Yu Huang, Zihua Zhao +5
An Agentic System for Rare Disease Diagnosis with Traceable Reasoning
Weike Zhao, Chaoyi Wu, Yanjie Fan +10
FedDisco: Federated Learning with Discrepancy-Aware Collaboration
Rui Ye, Mingkai Xu, Jianyu Wang +3
Federated Learning under Partially Class-Disjoint Data via Manifold Reshaping
Ziqing Fan, Jiangchao Yao, Ruipeng Zhang +3
Domain-Invariant Adversarial Learning for Unsupervised Domain Adaption
Yexun Zhang, Ya Zhang, Yanfeng Wang +1
Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal
Yuhao Wang, Zhiyuan Zhu, Heyang Liu +4
Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator
Yusheng Liao, Yutong Meng, Yuhao Wang +3
VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
Heyang Liu, Yuhao Wang, Ziyang Cheng +7
Towards Building Multilingual Language Model for Medicine
Pengcheng Qiu, Chaoyi Wu, Xiaoman Zhang +5
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
Heyang Liu, Yuhao Wang, Ziyang Cheng +4
Symbiotic Graph Neural Networks for 3D Skeleton-based Human Action Recognition and Motion Prediction
Maosen Li, Siheng Chen, Xu Chen +3
EqMotion: Equivariant Multi-agent Motion Prediction with Invariant Interaction Reasoning
Chenxin Xu, Robby T. Tan, Yuhong Tan +4
Hypergraph Transformer for Semi-Supervised Classification
Zexi Liu, Bohan Tang, Ziyuan Ye +3
Rethinking Whole-Body CT Image Interpretation: An Abnormality-Centric Approach
Ziheng Zhao, Lisong Dai, Ya Zhang +2
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
Yuzhu Cai, Zexi Liu, Xinyu Zhu +3
LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
Yikun Liu, Pingan Chen, Jiayin Cai +5
Multi-Sentence Grounding for Long-term Instructional Video
Zeqian Li, Qirui Chen, Tengda Han +3
Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling
Ning Liao, Xiaoxing Wang, Zehao Lin +18
Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases
Pengcheng Qiu, Chaoyi Wu, Shuyu Liu +7
Bag of Tricks for Long-Tailed Multi-Label Classification on Chest X-Rays
Feng Hong, Tianjie Dai, Jiangchao Yao +2
VocalBench-DF: A Benchmark for Evaluating Speech LLM Robustness to Disfluency
Hongcheng Liu, Yixuan Hou, Heyang Liu +3
GLM-OCR Technical Report
Shuaiqi Duan, Yadong Xue, Weihan Wang +20
MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition
Yuhuan Yang, Chaofan Ma, Zhenjie Mao +3
Fake It Till Make It: Federated Learning with Consensus-Oriented Generation
Rui Ye, Yaxin Du, Zhenyang Ni +2
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
Luoyi Sun, Xiao Zhou, Zeqian Li +3
MatchTime: Towards Automatic Soccer Game Commentary Generation
Jiayuan Rao, Haoning Wu, Chang Liu +2
DENOISER: Rethinking the Robustness for Open-Vocabulary Action Recognition
Haozhe Cheng, Cheng Ju, Haicheng Wang +5
Learning Contextualized Sentence Representations for Document-Level Neural Machine Translation
Pei Zhang, Xu Zhang, Wei Chen +3
Diversified Batch Selection for Training Acceleration
Feng Hong, Yueming Lyu, Jiangchao Yao +3
Federated Learning with Bilateral Curation for Partially Class-Disjoint Data
Ziqing Fan, Ruipeng Zhang, Jiangchao Yao +3
Knowledge-aware Bayesian Co-attention for Multimodal Emotion Recognition
Zihan Zhao, Yu Wang, Yanfeng Wang
Knowledge-enhanced Visual-Language Pre-training on Chest Radiology Images
Xiaoman Zhang, Chaoyi Wu, Ya Zhang +2
Unrolled Graph Learning for Multi-Agent Collaboration
Enpei Zhang, Shuo Tang, Xiaowen Dong +2
Nextformer: A ConvNeXt Augmented Conformer For End-To-End Speech Recognition
Yongjun Jiang, Jian Yu, Wenwen Yang +2
Boost Video Frame Interpolation via Motion Adaptation
Haoning Wu, Xiaoyun Zhang, Weidi Xie +2
JointRF: End-to-End Joint Optimization for Dynamic Neural Radiance Field Representation and Compression
Zihan Zheng, Houqiang Zhong, Qiang Hu +4
Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data
Chaoyi Wu, Xiaoman Zhang, Ya Zhang +2
VRVVC: Variable-Rate NeRF-Based Volumetric Video Compression
Qiang Hu, Houqiang Zhong, Zihan Zheng +5
Awesome Multi-modal Object Tracking
Chunhui Zhang, Li Liu, Hao Wen +2
FedRSU: Federated Learning for Scene Flow Estimation on Roadside Units
Shaoheng Fang, Rui Ye, Wenhao Wang +5
Leveraging Diverse Modeling Contexts with Collaborating Learning for Neural Machine Translation
Yusheng Liao, Yanfeng Wang, Yu Wang
Leveraging Unstructured Text Data for Federated Instruction Tuning of Large Language Models
Rui Ye, Rui Ge, Yuchi Fengting +3