Publications (75)
Decoupled IoU Regression for Object Detection
Yan Gao, Qimeng Wang, Xu Tang +4
PiClick: Picking the desired mask from multiple candidates in click-based interactive segmentation
Cilin Yan, Haochen Wang, Jie Liu +5
EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis
Xiangyuan Wang, Honghao Cai, Yunhao Bai +9
IdGlow: Dynamic Identity Modulation for Multi-Subject Generation
Honghao Cai, Xiangyuan Wang, Jing Li +15
End-to-end Temporal Action Detection with Transformer
Xiaolong Liu, Qimeng Wang, Yao Hu +4
PyramidBox++: High Performance Detector for Finding Tiny Face
Zhihang Li, Xu Tang, Junyu Han +2
ASM-UNet: Adaptive Scan Mamba Integrating Group Commonalities and Individual Variations for Fine-Grained Segmentation
Bo Wang, Mengyuan Xu, Yue Yan +6
Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning
Kepu Zhang, Guofu Xie, Weijie Yu +4
Single Trajectory Distillation for Accelerating Image and Video Style Transfer
Sijie Xu, Runqi Wang, Wei Zhu +4
Geometric structure of singular free boundary points for the logarithmic obstacle problem
Lili Du, Xu Tang, Yi Zhou
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
Hao-Han Guo, Yao Hu, Kun Liu +6
FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration
Kai-Tuo Xu, Feng-Long Xie, Xu Tang +1
FireRedASR2S: A State-of-the-Art Industrial-Grade All-in-One Automatic Speech Recognition System
Kaituo Xu, Yan Jia, Kai Huang +6
StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation
Zhengguang Zhou, Jing Li, Huaxia Li +2
Semantic-aware DropSplat: Adaptive Pruning of Redundant Gaussians for 3D Aerial-View Segmentation
Xu Tang, Junan Jia, Yijing Wang +2
CQ-DINO: Mitigating Gradient Dilution via Category Queries for Vast Vocabulary Object Detection
Zhichao Sun, Huazhang Hu, Yidong Ma +5
Uniqueness of blowup at singular points for superconductivity problem
Lili Du, Xu Tang, Cong Wang
InstantID: Zero-shot Identity-Preserving Generation in Seconds
Qixun Wang, Xu Bai, Haofan Wang +5
Learning Global Structure Consistency for Robust Object Tracking
Bi Li, Chengquan Zhang, Zhibin Hong +5
Rare earth permanent magnets prepared by hot deformation process
Ren-Jie Chen, Ze-Xuan Wang, Xu Tang +4
FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations
Junjie Chen, Yao Hu, Junjie Li +12
Unified Video-Language Pre-training with Synchronized Audio
Shentong Mo, Haofan Wang, Huaxia Li +1
Transformers Meet Visual Learning Understanding: A Comprehensive Review
Yuting Yang, Licheng Jiao, Xu Liu +4
DuBox: No-Prior Box Objection Detection via Residual Dual Scale Detectors
Shuai Chen, Jinpeng Li, Chuanqi Yao +4
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
Wenxuan Huang, Yu Zeng, Qiuchen Wang +14
HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues
Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw +46
Seeking Consensus: Geometric-Semantic On-the-Fly Recalibration for Open-Vocabulary Remote Sensing Semantic Segmentation
Guanchun Wang, Chenxiao Wu, Xiangrong Zhang +4
Semantic Attention and Scale Complementary Network for Instance Segmentation in Remote Sensing Images
Tianyang Zhang, Xiangrong Zhang, Peng Zhu +4
FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System
Hao-Han Guo, Yao Hu, Fei-Yu Shen +4
HyMiRec: A Hybrid Multi-interest Learning Framework for LLM-based Sequential Recommendation
Jingyi Zhou, Cheng Chen, Kai Zuo +5
Controllable Mind Visual Diffusion Model
Bohan Zeng, Shanglin Li, Xuhui Liu +6
DaYu: Data-Driven Model for Geostationary Satellite Observed Cloud Images Forecasting
Xujun Wei, Feng Zhang, Renhe Zhang +6
SSR-Encoder: Encoding Selective Subject Representation for Subject-Driven Generation
Yuxuan Zhang, Yiren Song, Jiaming Liu +8
Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer
Weiquan Lin, Yu Deng, Shiyang Liu +6
This survey systematically reviews how large foundation models provide geometric, semantic, and visual priors for hand‑object interaction tasks such as reconstruction and generatio…
Synthesizing Physically Plausible Human Motions in 3D Scenes
Liang Pan, Jingbo Wang, Buzhen Huang +4
Flux-Sculptor: Text-Driven Rich-Attribute Portrait Editing through Decomposed Spatial Flow Control
Tianyao He, Runqi Wang, Yang Chen +4
MEET: A Million-Scale Dataset for Fine-Grained Geospatial Scene Classification with Zoom-Free Remote Sensing Imagery
Yansheng Li, Yuning Wu, Gong Cheng +9
Edit Where You Mean: Region-Aware Adapter Injection for Mask-Free Local Image Editing
Honghao Cai, Xiangyuan Wang, Yunhao Bai +8
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
Yu Zeng, Wenxuan Huang, Zhen Fang +14
Remote Sensing Object Detection Meets Deep Learning: A Meta-review of Challenges and Advances
Xiangrong Zhang, Tianyang Zhang, Guanchun Wang +4
IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning
Zhichao Sun, Yidong Ma, Gang Liu +4
Polarimetric Convolutional Network for PolSAR Image Classification
Xu Liu, Licheng Jiao, Xu Tang +2
DynamicFace: High-Quality and Consistent Face Swapping for Image and Video using Composable 3D Facial Priors
Runqi Wang, Yang Chen, Sijie Xu +6
SoftMatch Distance: A Novel Distance for Weakly-Supervised Trend Change Detection in Bi-Temporal Images
Yuqun Yang, Xu Tang, Xiangrong Zhang +2
GeoHand: Unlocking Prior Geometry Knowledge for Monocular 3D Hand Reconstruction
Weiquan Lin, Yaoqing Hu, Liangchen Dai +2
Absolute Wrong Makes Better: Boosting Weakly Supervised Object Detection via Negative Deterministic Information
Guanchun Wang, Xiangrong Zhang, Zelin Peng +3
On a class of coupled obstacle systems
Lili Du, Xu Tang, Cong Wang
Federated Multi-Task Clustering
Suyan Dai, Gan Sun, Fazeng Li +3
PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On
Haohua Chen, Tianze Zhou, Wei Zhu +8
OvarNet: Towards Open-vocabulary Object Attribute Recognition
Keyan Chen, Xiaolong Jiang, Yao Hu +4
Cross-Scenario Unified Modeling of User Interests at Billion Scale
Manjie Xu, Cheng Chen, Xin Jia +9
FireRed-OCR Technical Report
Hao Wu, Haoran Lou, Xinyue Li +19
Persistent but weak magnetic field at Moon's midlife revealed by Chang'e-5 basalt
Shuhui Cai, Huafeng Qin, Huapei Wang +25
Mining Open Semantics from CLIP: A Relation Transition Perspective for Few-Shot Learning
Cilin Yan, Haochen Wang, Xiaolong Jiang +4
Multimodal Sense-Informed Prediction of 3D Human Motions
Zhenyu Lou, Qiongjie Cui, Haofan Wang +2
MVP-SEG: Multi-View Prompt Learning for Open-Vocabulary Semantic Segmentation
Jie Guo, Qimeng Wang, Yan Gao +4
RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services
Fei Zhao, Chonggang Lu, Haofu Qian +9
ReMatch: Boosting Representation through Matching for Multimodal Retrieval
Qianying Liu, Xiao Liang, Zhiqiang Zhang +6
ZONE: Zero-Shot Instruction-Guided Local Editing
Shanglin Li, Bohan Zeng, Yutang Feng +8
Deep Adaptive Proposal Network for Object Detection in Optical Remote Sensing Images
Lin Cheng, Xu Liu, Lingling Li +2
Beyond Guilt: Legal Judgment Prediction with Trichotomous Reasoning
Kepu Zhang, Haoyue Yang, Xu Tang +2
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
Wenxuan Huang, Bohan Jia, Zijie Zhai +7
HAMBox: Delving into Online High-quality Anchors Mining for Detecting Outer Faces
Yang Liu, Xu Tang, Xiang Wu +3
GeoFormer: Learning Point Cloud Completion with Tri-Plane Integrated Transformer
Jinpeng Yu, Binbin Huang, Yuxuan Zhang +3
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
Haoran Lou, Ziyan Liu, Chunxiao Fan +6
InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
Qiang Xiang, Shuang Sun, Binglei Li +6
StableGarment: Garment-Centric Generation via Stable Diffusion
Rui Wang, Hailong Guo, Jiaming Liu +6
ACMamba: Fast Unsupervised Anomaly Detection via An Asymmetrical Consensus State Space Model
Guanchun Wang, Xiangrong Zhang, Yifei Zhang +4
SVIP: Sequence VerIfication for Procedures in Videos
Yicheng Qian, Weixin Luo, Dongze Lian +3
CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression
Kangjie Zhang, Wenxuan Huang, Xin Zhou +9
Evolving Metric Learning for Incremental and Decremental Features
Jiahua Dong, Yang Cong, Gan Sun +3
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
Kun Xie, Feiyu Shen, Junjie Li +3
PyramidBox: A Context-assisted Single Shot Face Detector
Xu Tang, Daniel K. Du, Zeqiang He +1
FireRed-Image-Edit-1.0 Technical Report
Super Intelligence Team, Changhao Qiao, Chao Hui +16
Target-Driven Distillation: Consistency Distillation with Target Timestep Selection and Decoupled Guidance
Cunzheng Wang, Ziyuan Guo, Yuxuan Duan +4