NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (108)

cs.CV2025

OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning

Ling Fu, Zhebin Kuang, Jiajun Song +21

cs.CV2022

Don't Forget Me: Accurate Background Recovery for Text Removal via Modeling Local-Global Context

Chongyu Liu, Lianwen Jin, Yuliang Liu +4

cs.LG2022

DELTA: Dynamically Optimizing GPU Memory beyond Tensor Recomputation

Yu Tang, Chenyu Wang, Yufan Zhang +5

cs.AI2025

SlimPack: Fine-Grained Asymmetric Packing for Balanced and Efficient Variable-Length LLM Training

Yuliang Liu, Guohao Wu, Shenglong Zhang +4

cs.AI2025

Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning

Linger Deng, Linghao Zhu, Yuliang Liu +6

cs.CL2026

Context-level Language Modeling by Learning Predictive Context Embeddings

Beiya Dai, Yuliang Liu, Daozheng Xue +6

cs.DC2026

PROBE: Co-Balancing Computation and Communication in MoE Inference via Real-Time Predictive Prefetching

Qianchao Zhu, Xucheng Ye, Yuliang Liu +2

cs.LG2026

ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning

Chao Jin, Xinming Wei, Yinmin Zhong +6

cs.CV2026

GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving

Linger Deng, Yuliang Liu, Wenwen Yu +4

cs.CV2022

SAPA: Similarity-Aware Point Affiliation for Feature Upsampling

Hao Lu, Wenze Liu, Zixuan Ye +3

cs.CV2025

Deciphering Oracle Bone Language with Diffusion Models

Haisu Guan, Huanxin Yang, Xinyu Wang +5

cs.CV2019

Omnidirectional Scene Text Detection with Sequential-free Box Discretization

Yuliang Liu, Sheng Zhang, Lianwen Jin +3

cs.CV2025

Kling-Omni Technical Report

Kling Team, Jialu Chen, Yuanzheng Ci +65

cs.CV2024

Accountable Textual-Visual Chat Learns to Reject Human Instructions in Image Re-creation

Zhiwei Zhang, Yuliang Liu

cs.DC2026

ExpertPlex: A High-Goodput Disaggregated Serving System for MoE LLMs with Adaptive Persistent Kernels

Bingyang Wu, Chao Jin, Zili Zhang +6

cs.CV2024

Progressive Evolution from Single-Point to Polygon for Scene Text

Linger Deng, Mingxin Huang, Xudong Xie +3

cs.CV2020

Separating Content from Style Using Adversarial Learning for Recognizing Text in the Wild

Canjie Luo, Qingxiang Lin, Yuliang Liu +2

cs.CV2025

MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering

Jingqun Tang, Qi Liu, Yongjie Ye +14

cs.CV2023

ICDAR 2023 Competition on Structured Text Extraction from Visually-Rich Document Images

Wenwen Yu, Chengquan Zhang, Haoyu Cao +24

cs.CV2025

MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling

Liang Yin, Xudong Xie, Zhang Li +2

cs.CV2025

Training-free Geometric Image Editing on Diffusion Models

Hanshen Zhu, Zhen Zhu, Kaile Zhang +3

cs.CV2023

Box-DETR: Understanding and Boxing Conditional Spatial Queries

Wenze Liu, Hao Lu, Yuliang Liu +1

cond-mat.mes-hall2023

Transport Properties of a Quantum Dot Restudied by Algebraic Equation of Motion

Jiangqi Mao, Houmin Du, Yuliang Liu

cs.CV2025

VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning

Hao Yan, Xingchen Liu, Hao Wang +11

cs.CV2025

DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding

Wenwen Yu, Zhibo Yang, Yuliang Liu +1

cs.CV2024

OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition

Jianqiang Wan, Sibo Song, Wenwen Yu +6

cs.CV2023

SPTS v2: Single-Point Scene Text Spotting

Yuliang Liu, Jiaxin Zhang, Dezhi Peng +8

cs.LG2023

Colossal-AI: A Unified Deep Learning System For Large-Scale Parallel Training

Shenggui Li, Hongxin Liu, Zhengda Bian +5

cs.LG2025

SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training

Zhouyang Li, Yuliang Liu, Wei Zhang +4

cs.CV2024

TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document

Yuliang Liu, Biao Yang, Qiang Liu +4

cs.CV2024

Toward Real Text Manipulation Detection: New Dataset and New Solution

Dongliang Luo, Yuliang Liu, Rui Yang +4

cs.CV2026

ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding

Yiran Guan, Sifan Tu, Dingkang Liang +6

cs.CV2019

Aggregation Cross-Entropy for Sequence Recognition

Zecheng Xie, Yaoxiong Huang, Yuanzhi Zhu +3

cs.CV2026

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

Yiran Guan, Liang Yin, Dingkang Liang +5

cs.CV2025

WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?

An-Lan Wang, Jingqun Tang, Liao Lei +10

cs.CV2025

MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns

Jiarui Zhang, Yuliang Liu, Zijun Wu +17

cs.CV2024

The First Swahili Language Scene Text Detection and Recognition Dataset

Fadila Wendigoundi Douamba, Jianjun Song, Ling Fu +2

cs.CV2026

MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm

Zhang Li, Yuliang Liu, Qiang Liu +8

cs.AI2025

AdaptiveStep: Automatically Dividing Reasoning Step through Model Confidence

Yuliang Liu, Junjie Lu, Zhaoling Chen +10

cs.CV2025

TokBench: Evaluating Your Visual Tokenizer before Visual Generation

Junfeng Wu, Dongliang Luo, Weizhi Zhao +6

quant-ph2022

Atomic Coherence Assisted Multipartite Entanglement Generation with DELC Four-Wave Mixing

Yuliang Liu, Jiajia Wei, Mengqi Niu +7

cs.CV2017

Deep Matching Prior Network: Toward Tighter Multi-oriented Text Detection

Yuliang Liu, Lianwen Jin

cs.CV2025

Liquid: Language Models are Scalable and Unified Multi-modal Generators

Junfeng Wu, Yi Jiang, Chuofan Ma +5

cs.CV2024

Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid

Mingxin Huang, Yuliang Liu, Dingkang Liang +2

cs.NI2007

Hopf bifurcation analysis in a dual model of Internet congestion control algorithm with communication delay

Dawei Ding, Jie Zhu, Xiaoshu Luo +1

cs.CV2024

An open dataset for oracle bone script recognition and decipherment

Pengjie Wang, Kaile Zhang, Xinyu Wang +8

cs.LG2026

xHC: Expanded Hyper-Connections

Xiangdong Zhang, Xiaohan Qin, Sunan Zou +10

The paper introduces xHC, a method that expands the residual stream of Transformers to many parallel streams using temporal feature augmentation and a sparse update scheme, enablin…

#transformer architectures#residual stream expansion#large language models#efficient training
cs.CV2024

VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization

Yuliang Liu, Mingxin Huang, Hao Yan +6

cs.CV2026

MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios

Zhang Li, Zhibo Lin, Qiang Liu +7

nlin.CD2025

A Probability Space at Inception of Stochastic Process

Liteng Yang, Yuliang Liu, Jing Liu +2

cs.CL2024

ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code

Xiangru Tang, Yuliang Liu, Zefan Cai +21

cs.CV2025

SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting

Mingxin Huang, Dezhi Peng, Hongliang Li +6

cs.CV2024

Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization

Yang Jin, Zhicheng Sun, Kun Xu +9

cs.CV2022

SwinTextSpotter: Scene Text Spotting via Better Synergy between Text Detection and Text Recognition

Mingxin Huang, Yuliang Liu, Zhenghao Peng +6

cs.CV2022

SPTS: Single-Point Text Spotting

Dezhi Peng, Xinyu Wang, Yuliang Liu +9

cs.CV2023

ESTextSpotter: Towards Better Scene Text Spotting with Explicit Synergy in Transformer

Mingxin Huang, Jiaxin Zhang, Dezhi Peng +5

cs.CV2023

Looking and Listening: Audio Guided Text Recognition

Wenwen Yu, Mingyu Liu, Biao Yang +5

cs.CV2021

ABCNet v2: Adaptive Bezier-Curve Network for Real-time End-to-end Text Spotting

Yuliang Liu, Chunhua Shen, Lianwen Jin +4

cs.AI2024

An open dataset for the evolution of oracle bone characters: EVOBC

Haisu Guan, Jinpeng Wan, Yuliang Liu +6

cs.LG2026

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Linghao Zhu, Yiran Guan, Dingkang Liang +6

cs.CV2020

ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Network

Yuliang Liu, Hao Chen, Chunhua Shen +3

cs.LG2026

Heddle: A Distributed Orchestration System for Agentic RL Rollout

Zili Zhang, Yinmin Zhong, Chengxu Yang +5

cs.CV2024

MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks

Xingkui Zhu, Yiran Guan, Dingkang Liang +3

cs.LG2023

Colossal-Auto: Unified Automation of Parallelization and Activation Checkpoint for Large-scale Models

Yuliang Liu, Shenggui Li, Jiarui Fang +3

cs.CL2026

Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models

Yuliang Liu, Yunchong Song, Yixuan Wang +6

cs.CL2023

KwaiYiiMath: Technical Report

Jiayi Fu, Lei Lin, Xiaoyang Gao +18

cs.CV2025

Privacy-Preserving Biometric Verification with Handwritten Random Digit String

Peirong Zhang, Yuliang Liu, Songxuan Lai +2

cs.CV2019

ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT

Yipeng Sun, Zihan Ni, Chee-Kheng Chng +9

cs.CV2025

SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting

Dongliang Luo, Hanshen Zhu, Ziyang Zhang +4

cs.CV2023

On Point Affiliation in Feature Upsampling

Wenze Liu, Hao Lu, Yuliang Liu +1

cs.CV2019

ICDAR2019 Robust Reading Challenge on Arbitrary-Shaped Text (RRC-ArT)

Chee-Kheng Chng, Yuliang Liu, Yipeng Sun +11

cs.CV2023

Turning a CLIP Model into a Scene Text Spotter

Wenwen Yu, Yuliang Liu, Xingkui Zhu +3

cs.CV2023

Enhancing Scene Text Detectors with Realistic Text Image Synthesis Using Diffusion Models

Ling Fu, Zijie Wu, Yingying Zhu +2

cs.CV2022

MSDS: A Large-Scale Chinese Signature and Token Digit String Dataset for Handwriting Verification

Peirong Zhang, Jiajia Jiang, Yuliang Liu +1

cs.CV2026

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

Yuliang Liu, Zhang Li, Ziyang Zhang +11

cs.CV2023

ICDAR 2023 Competition on Reading the Seal Title

Wenwen Yu, Mingyu Liu, Mingrui Chen +5

cs.CV2024

OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

Yuliang Liu, Zhang Li, Mingxin Huang +7

cs.CV2026

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

Pengjie Wang, Linger Deng, Zujia Zhang +6

cs.CV2026

TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering

Hanshen Zhu, Yuliang Liu, Xuecheng Wu +7

cs.NI2007

Controlling Delay-induced Hopf bifurcation in Internet congestion control system

Dawei Ding, Jie Zhu, Xiaoshu Luo +1

cs.CV2024

Puzzle Pieces Picker: Deciphering Ancient Chinese Characters with Radical Reconstruction

Pengjie Wang, Kaile Zhang, Xinyu Wang +5

cs.CV2018

EnsNet: Ensconce Text in the Wild

Shuaitao Zhang, Yuliang Liu, Lianwen Jin +2

cs.CV2018

DeRPN: Taking a further step toward more general object detection

Lele Xie, Yuliang Liu, Lianwen Jin +1

cs.HC2026

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

Yuliang Liu, Haisu Guan, Pengjie Wang +11

cs.CV2022

PageNet: Towards End-to-End Weakly Supervised Page-Level Handwritten Chinese Text Recognition

Dezhi Peng, Lianwen Jin, Yuliang Liu +2

cs.CV2020

On the General Value of Evidence, and Bilingual Scene-Text Visual Question Answering

Xinyu Wang, Yuliang Liu, Chunhua Shen +6

cs.LG2026

BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

Zili Zhang, Chengxu Yang, Shenglong Zhang +8

cs.CL2024

LongRecipe: Recipe for Efficient Long Context Generalization in Large Language Models

Zhiyuan Hu, Yuliang Liu, Jinman Zhao +8

cs.CV2024

Bridging the Gap Between End-to-End and Two-Step Text Spotting

Mingxin Huang, Hongliang Li, Yuliang Liu +2

cs.CL2024

Exploring the Capabilities of Large Multimodal Models on Dense Text

Shuo Zhang, Biao Yang, Zhang Li +3

cs.CV2021

ICDAR 2021 Competition on Integrated Circuit Text Spotting and Aesthetic Assessment

Chun Chet Ng, Akmalul Khairi Bin Nazaruddin, Yeong Khang Lee +6

cs.CV2017

Feature Enhancement Network: A Refined Scene Text Detector

Sheng Zhang, Yuliang Liu, Lianwen Jin +1

cs.CV2019

Tightness-aware Evaluation Protocol for Scene Text Detection

Yuliang Liu, Lianwen Jin, Zecheng Xie +3

cs.AI2026

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

Hao Yan, Yuliang Liu, Xingchen Liu +5

cs.CV2025

TextSquare: Scaling up Text-Centric Visual Instruction Tuning

Jingqun Tang, Chunhui Lin, Zhen Zhao +15

cs.CV2026

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

Xudong Xie, Hao Yan, Liang Yin +6

cs.CV2021

Exploring the Capacity of an Orderless Box Discretization Network for Multi-orientation Scene Text Detection

Yuliang Liu, Tong He, Hao Chen +5

cs.CV2026

Multimodal OCR: Parse Anything from Documents

Handong Zheng, Yumeng Li, Kaile Zhang +22

cs.CL2026

Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization

Junjie Lu, Yuliang Liu, Chaofeng Qu +4

cs.CV2024

ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining

Dezhi Peng, Chongyu Liu, Yuliang Liu +1