NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (75)

cs.CV2022

Decoupled IoU Regression for Object Detection

Yan Gao, Qimeng Wang, Xu Tang +4

cs.CV2024

PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation

Cilin Yan, Haochen Wang, Jie Liu +5

cs.CV2026

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

Xiangyuan Wang, Honghao Cai, Yunhao Bai +9

cs.CV2026

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

Honghao Cai, Xiangyuan Wang, Jing Li +15

cs.CV2022

End-to-end Temporal Action Detection with Transformer

Xiaolong Liu, Qimeng Wang, Yao Hu +4

cs.CV2019

PyramidBox++: High Performance Detector for Finding Tiny Face

Zhihang Li, Xu Tang, Junyu Han +2

cs.CV2025

ASM-UNet: Adaptive Scan Mamba Integrating Group Commonalities and Individual Variations for Fine-Grained Segmentation

Bo Wang, Mengyuan Xu, Yue Yan +6

cs.CL2025

Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning

Kepu Zhang, Guofu Xie, Weijie Yu +4

cs.CV2024

Single Trajectory Distillation for Accelerating Image and Video Style Transfer

Sijie Xu, Runqi Wang, Wei Zhu +4

math.AP2026

Geometric structure of singular free boundary points for the logarithmic obstacle problem

Lili Du, Xu Tang, Yi Zhou

cs.SD2025

FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications

Hao-Han Guo, Yao Hu, Kun Liu +6

eess.AS2025

FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration

Kai-Tuo Xu, Feng-Long Xie, Xu Tang +1

eess.AS2026

FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System

Kaituo Xu, Yan Jia, Kai Huang +6

cs.CV2024

StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation

Zhengguang Zhou, Jing Li, Huaxia Li +2

cs.CV2025

Semantic-aware DropSplat: Adaptive Pruning of Redundant Gaussians for 3D Aerial-View Segmentation

Xu Tang, Junan Jia, Yijing Wang +2

cs.CV2025

CQ-DINO: Mitigating Gradient Dilution via Category Queries for Vast Vocabulary Object Detection

Zhichao Sun, Huazhang Hu, Yidong Ma +5

math.AP2023

Uniqueness of blowup at singular points for superconductivity problem

Lili Du, Xu Tang, Cong Wang

cs.CV2024

InstantID: Zero-shot Identity-Preserving Generation in Seconds

Qixun Wang, Xu Bai, Haofan Wang +5

cs.CV2020

Learning Global Structure Consistency for Robust Object Tracking

Bi Li, Chengquan Zhang, Zhibin Hong +5

cond-mat.mtrl-sci2018

Rare earth permanent magnets prepared by hot deformation process

Ren-Jie Chen, Ze-Xuan Wang, Xu Tang +4

cs.SD2025

FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations

Junjie Chen, Yao Hu, Junjie Li +12

cs.CV2024

Unified Video-Language Pre-training with Synchronized Audio

Shentong Mo, Haofan Wang, Huaxia Li +1

cs.CV2022

Transformers Meet Visual Learning Understanding: A Comprehensive Review

Yuting Yang, Licheng Jiao, Xu Liu +4

cs.CV2019

DuBox: No-Prior Box Objection Detection via Residual Dual Scale Detectors

Shuai Chen, Jinpeng Li, Chuanqi Yao +4

cs.CV2026

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Wenxuan Huang, Yu Zeng, Qiuchen Wang +14

q-bio.QM2026

HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues

Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw +46

cs.CV2026

Seeking Consensus: Geometric-Semantic On-the-Fly Recalibration for Open-Vocabulary Remote Sensing Semantic Segmentation

Guanchun Wang, Chenxiao Wu, Xiangrong Zhang +4

cs.CV2021

Semantic Attention and Scale Complementary Network for Instance Segmentation in Remote Sensing Images

Tianyang Zhang, Xiangrong Zhang, Peng Zhu +4

cs.SD2025

FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System

Hao-Han Guo, Yao Hu, Fei-Yu Shen +4

cs.IR2025

HyMiRec: A Hybrid Multi-interest Learning Framework for LLM-based Sequential Recommendation

Jingyi Zhou, Cheng Chen, Kai Zuo +5

cs.CV2023

Controllable Mind Visual Diffusion Model

Bohan Zeng, Shanglin Li, Xuhui Liu +6

physics.ao-ph2024

DaYu: Data-Driven Model for Geostationary Satellite Observed Cloud Images Forecasting

Xujun Wei, Feng Zhang, Renhe Zhang +6

cs.CV2024

SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven Generation

Yuxuan Zhang, Yiren Song, Jiaming Liu +8

cs.CV2026

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

Weiquan Lin, Yu Deng, Shiyang Liu +6

This survey systematically reviews how large foundation models provide geometric, semantic, and visual priors for hand‑object interaction tasks such as reconstruction and generatio…

#hand-object interaction#foundation models#reconstruction#generation
cs.CV2025

Synthesizing Physically Plausible Human Motions in 3D Scenes

Liang Pan, Jingbo Wang, Buzhen Huang +4

cs.CV2025

Flux-Sculptor: Text-Driven Rich-Attribute Portrait Editing through Decomposed Spatial Flow Control

Tianyao He, Runqi Wang, Yang Chen +4

cs.CV2025

MEET: A Million-Scale Dataset for Fine-Grained Geospatial Scene Classification with Zoom-Free Remote Sensing Imagery

Yansheng Li, Yuning Wu, Gong Cheng +9

cs.CV2026

Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing

Honghao Cai, Xiangyuan Wang, Yunhao Bai +8

cs.CV2026

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

Yu Zeng, Wenxuan Huang, Zhen Fang +14

cs.CV2023

Remote Sensing Object Detection Meets Deep Learning: A Meta-review of Challenges and Advances

Xiangrong Zhang, Tianyang Zhang, Guanchun Wang +4

cs.CV2026

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

Zhichao Sun, Yidong Ma, Gang Liu +4

cs.CV2019

Polarimetric Convolutional Network for PolSAR Image Classification

Xu Liu, Licheng Jiao, Xu Tang +2

cs.CV2025

DynamicFace: High-Quality and Consistent Face Swapping for Image and Video using Composable 3D Facial Priors

Runqi Wang, Yang Chen, Sijie Xu +6

cs.CV2023

SoftMatch Distance: A Novel Distance for Weakly-Supervised Trend Change Detection in Bi-Temporal Images

Yuqun Yang, Xu Tang, Xiangrong Zhang +2

cs.CV2026

GeoHand: Unlocking Prior Geometry Knowledge for Monocular 3D Hand Reconstruction

Weiquan Lin, Yaoqing Hu, Liangchen Dai +2

cs.CV2023

Absolute Wrong Makes Better: Boosting Weakly Supervised Object Detection via Negative Deterministic Information

Guanchun Wang, Xiangrong Zhang, Zelin Peng +3

math.AP2024

On a class of coupled obstacle systems

Lili Du, Xu Tang, Cong Wang

cs.LG2026

Federated Multi-Task Clustering

Suyan Dai, Gan Sun, Fazeng Li +3

cs.CV2026

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

Haohua Chen, Tianze Zhou, Wei Zhu +8

cs.CV2023

OvarNet: Towards Open-vocabulary Object Attribute Recognition

Keyan Chen, Xiaolong Jiang, Yao Hu +4

cs.IR2025

Cross-Scenario Unified Modeling of User Interests at Billion Scale

Manjie Xu, Cheng Chen, Xin Jia +9

cs.CV2026

FireRed-OCR Technical Report

Hao Wu, Haoran Lou, Xinyue Li +19

physics.geo-ph2024

Persistent but weak magnetic field at Moon's midlife revealed by Chang'e-5 basalt

Shuhui Cai, Huafeng Qin, Huapei Wang +25

cs.CV2024

Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning

Cilin Yan, Haochen Wang, Xiaolong Jiang +4

cs.CV2024

Multimodal Sense-Informed Prediction of 3D Human Motions

Zhenyu Lou, Qiongjie Cui, Haofan Wang +2

cs.CV2023

MVP-SEG: Multi-View Prompt Learning for Open-Vocabulary Semantic Segmentation

Jie Guo, Qimeng Wang, Yan Gao +4

cs.AI2025

RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services

Fei Zhao, Chonggang Lu, Haofu Qian +9

cs.CV2025

ReMatch: Boosting Representation through Matching for Multimodal Retrieval

Qianying Liu, Xiao Liang, Zhiqiang Zhang +6

cs.CV2024

ZONE: Zero-Shot Instruction-Guided Local Editing

Shanglin Li, Bohan Zeng, Yutang Feng +8

cs.CV2018

Deep Adaptive Proposal Network for Object Detection in Optical Remote Sensing Images

Lin Cheng, Xu Liu, Lingling Li +2

cs.CL2025

Beyond Guilt: Legal Judgment Prediction with Trichotomous Reasoning

Kepu Zhang, Haoyue Yang, Xu Tang +2

cs.CV2026

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Wenxuan Huang, Bohan Jia, Zijie Zhai +7

cs.CV2019

HAMBox: Delving into Online High-quality Anchors Mining for Detecting Outer Faces

Yang Liu, Xu Tang, Xiang Wu +3

cs.CV2024

GeoFormer: Learning Point Cloud Completion with Tri-Plane Integrated Transformer

Jinpeng Yu, Binbin Huang, Yuxuan Zhang +3

cs.CV2026

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

Haoran Lou, Ziyan Liu, Chunxiao Fan +6

cs.CV2025

InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention

Qiang Xiang, Shuang Sun, Binglei Li +6

cs.CV2024

StableGarment: Garment-Centric Generation via Stable Diffusion

Rui Wang, Hailong Guo, Jiaming Liu +6

cs.CV2025

ACMamba: Fast Unsupervised Anomaly Detection via An Asymmetrical Consensus State Space Model

Guanchun Wang, Xiangrong Zhang, Yifei Zhang +4

cs.CV2022

SVIP: Sequence VerIfication for Procedures in Videos

Yicheng Qian, Weixin Luo, Dongze Lian +3

cs.CV2026

CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression

Kangjie Zhang, Wenxuan Huang, Xin Zhou +9

cs.LG2021

Evolving Metric Learning for Incremental and Decremental Features

Jiahua Dong, Yang Cong, Gan Sun +3

cs.SD2025

FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot

Kun Xie, Feiyu Shen, Junjie Li +3

cs.CV2018

PyramidBox: A Context-assisted Single Shot Face Detector

Xu Tang, Daniel K. Du, Zeqiang He +1

cs.CV2026

FireRed-Image-Edit-1.0 Technical Report

Super Intelligence Team, Changhao Qiao, Chao Hui +16

cs.CV2024

Target-Driven Distillation: Consistency Distillation with Target Timestep Selection and Decoupled Guidance

Cunzheng Wang, Ziyuan Guo, Yuxuan Duan +4