papers

Publications (70)

stat.AP2024

Comparing baseball players across eras via novel Full House Modeling

Shen Yan, Adrian Burgos, Christopher Kinson +1

cs.CV2025

Understanding and Harnessing Sparsity in Unified Multimodal Models

Shwai He, Chaorui Deng, Ang Li +1

cs.LG2025

Virtual Width Networks

Seed, Baisheng Li, Banggu Wu +115

cs.CV2022

Deep AutoAugment

Yu Zheng, Zhi Zhang, Shen Yan +1

cs.CV2025

Autoregressive Models in Vision: A Survey

Jing Xiong, Gongye Liu, Lun Huang +17

cs.CV2020

Does Unsupervised Architecture Representation Learning Help Neural Architecture Search?

Shen Yan, Yu Zheng, Wei Ao +2

cs.CV2026

AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision

Xiaoya Cheng, Rouwan Wu, Xinyi Liu +6

stat.ML2020

Improve Unsupervised Domain Adaptation with Mixup Training

Shen Yan, Huan Song, Nanxiang Li +2

cs.CL2025

Model Merging in Pre-training of Large Language Models

Yunshui Li, Yiyuan Ma, Shen Yan +23

cs.CV2025

When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought

Yiyang Zhou, Haoqin Tu, Zijun Wang +11

cs.CV2025

Visual Spatial Tuning

Rui Yang, Ziyu Zhu, Yanwei Li +9

cs.CV2026

Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts

Xi Chen, Maojun Zhang, Yu Liu +1

cs.SI2018

Social Bots for Online Public Health Interventions

Ashok Deb, Anuja Majmundar, Sungyong Seo +5

cs.LG2022

FairFed: Enabling Group Fairness in Federated Learning

Yahya H. Ezzeldin, Shen Yan, Chaoyang He +2

cs.CV2022

Multiview Transformers for Video Recognition

Shen Yan, Xuehan Xiong, Anurag Arnab +4

cs.CV2026

SpatialTree: How Spatial Abilities Branch Out in MLLMs

Yuxi Xiao, Longfei Li, Shen Yan +5

cs.CV2024

CompCap: Improving Multimodal Large Language Models with Composite Captions

Xiaohui Chen, Satya Narayan Shukla, Mahmoud Azab +8

cs.LG2019

HM-NAS: Efficient Neural Architecture Search via Hierarchical Masking

Shen Yan, Biyi Fang, Faen Zhang +4

cs.CL2025

Parallel Loop Transformer for Efficient Test-Time Computation Scaling

Bohong Wu, Mengzhao Chen, Xiang Luo +9

cs.CV2020

MutualNet: Adaptive ConvNet via Mutual Learning from Network Width and Resolution

Taojiannan Yang, Sijie Zhu, Chen Chen +3

cs.CV2026

PiLoT v2: Pixel-to-Orthogonal Map Alignment for Free-view UAV Geo-localization

Xinyi Liu, Xiaoya Cheng, Rouwan Wu +4

cs.CV2020

Image Retrieval for Structure-from-Motion via Graph Convolutional Network

Shen Yan, Yang Pen, Shiming Lai +2

cs.CV2024

PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter

Junfei Xiao, Zheng Xu, Alan Yuille +2

cs.CV2023

Pixel Aligned Language Models

Jiarui Xu, Xingyi Zhou, Shen Yan +5

cs.CV2024

Streaming Dense Video Captioning

Xingyi Zhou, Anurag Arnab, Shyamal Buch +5

cs.CL2026

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

Chenyang Yang, Shen Yan, Yibo Yang +13

cs.CV2025

CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning

Hao Yu, Zhuokai Zhao, Shen Yan +7

cs.NE2023

Training High-Performance Low-Latency Spiking Neural Networks by Differentiation on Spike Representation

Qingyan Meng, Mingqing Xiao, Shen Yan +3

cs.CL2025

SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning

Zhongwei Wan, Zhihao Dou, Che Liu +11

cs.CL2025

Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS

Alex ZH Dou, Zhongwei Wan, Dongfei Cui +6

cs.CL2024

Efficient Large Language Models: A Survey

Zhongwei Wan, Xin Wang, Che Liu +9

cs.IT2021

The Twelvefold Way of Non-Sequential Lossless Compression

Taha Ameen ur Rahman, Alton S. Barbehenn, Xinan Chen +27

cs.CV2025

Generalizable Multispectral Land Cover Classification via Frequency-Aware Mixture of Low-Rank Token Experts

Xi Chen, Shen Yan, Juelin Zhu +3

cs.DC2026

MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production

Chunyu Xue, Yangrui Chen, Jianyu Jiang +14

cs.CV2024

Soft Augmentation for Image Classification

Yang Liu, Shen Yan, Laura Leal-Taixé +2

cs.CV2025

ViGG: Robust RGB-D Point Cloud Registration using Visual-Geometric Mutual Guidance

Congjia Chen, Shen Yan, Yufu Qu

cs.CV2024

Incremental Multiview Point Cloud Registration

Xiaoya Cheng, Yu Liu, Maojun Zhang +1

cs.CV2023

AutoTaskFormer: Searching Vision Transformers for Multi-task Learning

Yang Liu, Shen Yan, Yuge Zhang +5

cs.CV2026

PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization

Xiaoya Cheng, Long Wang, Yan Liu +5

cs.CV2024

Render-and-Compare: Cross-View 6 DoF Localization from Noisy Prior

Shen Yan, Xiaoya Cheng, Yuxiang Liu +4

cs.CV2023

VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners

Shen Yan, Tao Zhu, Zirui Wang +5

cs.LG2020

Deep Learning in the Era of Edge Computing: Challenges and Opportunities

Mi Zhang, Faen Zhang, Nicholas D. Lane +5

cs.CV2023

UnLoc: A Unified Framework for Video Localization Tasks

Shen Yan, Xuehan Xiong, Arsha Nagrani +5

cs.CV2018

Learning Low-shot facial representations via 2D warping

Shen Yan

cs.CV2025

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Team Seedance, Heyi Chen, Siyan Chen +194

cs.CV2023

Long-term Visual Localization with Mobile Sensors

Shen Yan, Yu Liu, Long Wang +6

cs.CV2025

NTR-Gaussian: Nighttime Dynamic Thermal Reconstruction with 4D Gaussian Splatting Based on Thermodynamics

Kun Yang, Yuxiang Liu, Zeyu Cui +4

cs.LG2021

NAS-Bench-x11 and the Power of Learning Curves

Shen Yan, Colin White, Yash Savani +1

cs.CL2019

Word-based Domain Adaptation for Neural Machine Translation

Shen Yan, Leonard Dahlmann, Pavel Petrushkov +2

cond-mat.mes-hall2021

Quantifying the Temperature of Heated Microdevices Using Scanning Thermal Probes

Amin Reihani, Shen Yan, Yuxuan Luan +3

cs.CV2019

Unsupervised Visual Representation Learning with Increasing Object Shape Bias

Zhibo Wang, Shen Yan, Xiaoyu Zhang +1

cs.CV2025

VideoPrism: A Foundational Visual Encoder for Video Understanding

Long Zhao, Nitesh B. Gundavarapu, Liangzhe Yuan +16

cs.CV2025

MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency

Dongzhi Jiang, Renrui Zhang, Ziyu Guo +11

cs.CL2025

Efficient Pretraining Length Scaling

Bohong Wu, Shen Yan, Sijun Zhang +4

cs.CV2025

SparseFocus: Learning-based One-shot Autofocus for Microscopy with Sparse Content

Yongping Zhai, Xiaoxi Fu, Qiang Su +8

cs.AI2026

Knowledge Index of Noah's Ark

Sheng Jin, Minghao Liu, Yunze Xiao +24

cs.CV2024

LoD-Loc: Aerial Visual Localization using LoD 3D Map with Neural Wireframe Alignment

Juelin Zhu, Shen Yan, Long Wang +3

cs.CL2025

Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Gheorghe Comanici, Eric Bieber, Mike Schaekermann +3431

cs.CL2025

Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning

ByteDance Seed, :, Jiaze Chen +267

cs.CV2024

UAVD4L: A Large-Scale Dataset for UAV 6-DoF Localization

Rouwan Wu, Xiaoya Cheng, Juelin Zhu +3

math.OC2020

Bregman Augmented Lagrangian and Its Acceleration

Shen Yan, Niao He

cs.CV2026

LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment

Shuaibang Peng, Juelin Zhu, Xia Li +4

cs.CL2026

Dynamic Linear Attention

Xin Wang, Hui Shen, Boyuan Zheng +7

cs.CV2025

Seed1.5-VL Technical Report

Dong Guo, Faming Wu, Feida Zhu +194

cs.AI2026

Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields

Liya Zhu, Jingzhe Ding, Jian Zhang +63

cs.LG2026

On the Residual Scaling of Looped Transformers: Stability and Transferability

Shaowen Wang, Bingrui Li, Ge Zhang +3

cs.NE2023

Towards Memory- and Time-Efficient Backpropagation for Training Spiking Neural Networks

Qingyan Meng, Mingqing Xiao, Shen Yan +3

cs.CV2025

LoD-Loc v2: Aerial Visual Localization over Low Level-of-Detail City Models using Explicit Silhouette Alignment

Juelin Zhu, Shuaibang Peng, Long Wang +4

cs.LG2021

CATE: Computation-aware Neural Architecture Encoding with Transformers

Shen Yan, Kaiqiang Song, Fei Liu +1

cs.CV2026

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

Zhaowei Wang, Lishu Luo, Haodong Duan +9