Publications (70)
Comparing baseball players across eras via novel Full House Modeling
Shen Yan, Adrian Burgos, Christopher Kinson +1
Understanding and Harnessing Sparsity in Unified Multimodal Models
Shwai He, Chaorui Deng, Ang Li +1
Virtual Width Networks
Seed, Baisheng Li, Banggu Wu +115
Deep AutoAugment
Yu Zheng, Zhi Zhang, Shen Yan +1
Autoregressive Models in Vision: A Survey
Jing Xiong, Gongye Liu, Lun Huang +17
Does Unsupervised Architecture Representation Learning Help Neural Architecture Search?
Shen Yan, Yu Zheng, Wei Ao +2
AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision
Xiaoya Cheng, Rouwan Wu, Xinyi Liu +6
Improve Unsupervised Domain Adaptation with Mixup Training
Shen Yan, Huan Song, Nanxiang Li +2
Model Merging in Pre-training of Large Language Models
Yunshui Li, Yiyuan Ma, Shen Yan +23
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
Yiyang Zhou, Haoqin Tu, Zijun Wang +11
Visual Spatial Tuning
Rui Yang, Ziyu Zhu, Yanwei Li +9
Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts
Xi Chen, Maojun Zhang, Yu Liu +1
Social Bots for Online Public Health Interventions
Ashok Deb, Anuja Majmundar, Sungyong Seo +5
FairFed: Enabling Group Fairness in Federated Learning
Yahya H. Ezzeldin, Shen Yan, Chaoyang He +2
Multiview Transformers for Video Recognition
Shen Yan, Xuehan Xiong, Anurag Arnab +4
SpatialTree: How Spatial Abilities Branch Out in MLLMs
Yuxi Xiao, Longfei Li, Shen Yan +5
CompCap: Improving Multimodal Large Language Models with Composite Captions
Xiaohui Chen, Satya Narayan Shukla, Mahmoud Azab +8
HM-NAS: Efficient Neural Architecture Search via Hierarchical Masking
Shen Yan, Biyi Fang, Faen Zhang +4
Parallel Loop Transformer for Efficient Test-Time Computation Scaling
Bohong Wu, Mengzhao Chen, Xiang Luo +9
MutualNet: Adaptive ConvNet via Mutual Learning from Network Width and Resolution
Taojiannan Yang, Sijie Zhu, Chen Chen +3
PiLoT v2: Pixel-to-Orthogonal Map Alignment for Free-view UAV Geo-localization
Xinyi Liu, Xiaoya Cheng, Rouwan Wu +4
Image Retrieval for Structure-from-Motion via Graph Convolutional Network
Shen Yan, Yang Pen, Shiming Lai +2
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
Junfei Xiao, Zheng Xu, Alan Yuille +2
Pixel Aligned Language Models
Jiarui Xu, Xingyi Zhou, Shen Yan +5
Streaming Dense Video Captioning
Xingyi Zhou, Anurag Arnab, Shyamal Buch +5
Detecting AI-Generated Content on Social Media with Multi-modal Language Models
Chenyang Yang, Shen Yan, Yibo Yang +13
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
Hao Yu, Zhuokai Zhao, Shen Yan +7
Training High-Performance Low-Latency Spiking Neural Networks by Differentiation on Spike Representation
Qingyan Meng, Mingqing Xiao, Shen Yan +3
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
Zhongwei Wan, Zhihao Dou, Che Liu +11
Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS
Alex ZH Dou, Zhongwei Wan, Dongfei Cui +6
Efficient Large Language Models: A Survey
Zhongwei Wan, Xin Wang, Che Liu +9
The Twelvefold Way of Non-Sequential Lossless Compression
Taha Ameen ur Rahman, Alton S. Barbehenn, Xinan Chen +27
Generalizable Multispectral Land Cover Classification via Frequency-Aware Mixture of Low-Rank Token Experts
Xi Chen, Shen Yan, Juelin Zhu +3
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
Chunyu Xue, Yangrui Chen, Jianyu Jiang +14
Soft Augmentation for Image Classification
Yang Liu, Shen Yan, Laura Leal-Taixé +2
ViGG: Robust RGB-D Point Cloud Registration using Visual-Geometric Mutual Guidance
Congjia Chen, Shen Yan, Yufu Qu
Incremental Multiview Point Cloud Registration
Xiaoya Cheng, Yu Liu, Maojun Zhang +1
AutoTaskFormer: Searching Vision Transformers for Multi-task Learning
Yang Liu, Shen Yan, Yuge Zhang +5
PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization
Xiaoya Cheng, Long Wang, Yan Liu +5
Render-and-Compare: Cross-View 6 DoF Localization from Noisy Prior
Shen Yan, Xiaoya Cheng, Yuxiang Liu +4
VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners
Shen Yan, Tao Zhu, Zirui Wang +5
Deep Learning in the Era of Edge Computing: Challenges and Opportunities
Mi Zhang, Faen Zhang, Nicholas D. Lane +5
UnLoc: A Unified Framework for Video Localization Tasks
Shen Yan, Xuehan Xiong, Arsha Nagrani +5
Learning Low-shot facial representations via 2D warping
Shen Yan
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
Team Seedance, Heyi Chen, Siyan Chen +194
Long-term Visual Localization with Mobile Sensors
Shen Yan, Yu Liu, Long Wang +6
NTR-Gaussian: Nighttime Dynamic Thermal Reconstruction with 4D Gaussian Splatting Based on Thermodynamics
Kun Yang, Yuxiang Liu, Zeyu Cui +4
NAS-Bench-x11 and the Power of Learning Curves
Shen Yan, Colin White, Yash Savani +1
Word-based Domain Adaptation for Neural Machine Translation
Shen Yan, Leonard Dahlmann, Pavel Petrushkov +2
Quantifying the Temperature of Heated Microdevices Using Scanning Thermal Probes
Amin Reihani, Shen Yan, Yuxuan Luan +3
Unsupervised Visual Representation Learning with Increasing Object Shape Bias
Zhibo Wang, Shen Yan, Xiaoyu Zhang +1
VideoPrism: A Foundational Visual Encoder for Video Understanding
Long Zhao, Nitesh B. Gundavarapu, Liangzhe Yuan +16
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
Dongzhi Jiang, Renrui Zhang, Ziyu Guo +11
Efficient Pretraining Length Scaling
Bohong Wu, Shen Yan, Sijun Zhang +4
SparseFocus: Learning-based One-shot Autofocus for Microscopy with Sparse Content
Yongping Zhai, Xiaoxi Fu, Qiang Su +8
Knowledge Index of Noah's Ark
Sheng Jin, Minghao Liu, Yunze Xiao +24
LoD-Loc: Aerial Visual Localization using LoD 3D Map with Neural Wireframe Alignment
Juelin Zhu, Shen Yan, Long Wang +3
Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Gheorghe Comanici, Eric Bieber, Mike Schaekermann +3431
Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning
ByteDance Seed, :, Jiaze Chen +267
UAVD4L: A Large-Scale Dataset for UAV 6-DoF Localization
Rouwan Wu, Xiaoya Cheng, Juelin Zhu +3
Bregman Augmented Lagrangian and Its Acceleration
Shen Yan, Niao He
LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment
Shuaibang Peng, Juelin Zhu, Xia Li +4
Dynamic Linear Attention
Xin Wang, Hui Shen, Boyuan Zheng +7
Seed1.5-VL Technical Report
Dong Guo, Faming Wu, Feida Zhu +194
Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields
Liya Zhu, Jingzhe Ding, Jian Zhang +63
On the Residual Scaling of Looped Transformers: Stability and Transferability
Shaowen Wang, Bingrui Li, Ge Zhang +3
Towards Memory- and Time-Efficient Backpropagation for Training Spiking Neural Networks
Qingyan Meng, Mingqing Xiao, Shen Yan +3
LoD-Loc v2: Aerial Visual Localization over Low Level-of-Detail City Models using Explicit Silhouette Alignment
Juelin Zhu, Shuaibang Peng, Long Wang +4
CATE: Computation-aware Neural Architecture Encoding with Transformers
Shen Yan, Kaiqiang Song, Fei Liu +1
Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
Zhaowei Wang, Lishu Luo, Haodong Duan +9