Publications (108)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
Ling Fu, Zhebin Kuang, Jiajun Song +21
Don't Forget Me: Accurate Background Recovery for Text Removal via Modeling Local-Global Context
Chongyu Liu, Lianwen Jin, Yuliang Liu +4
DELTA: Dynamically Optimizing GPU Memory beyond Tensor Recomputation
Yu Tang, Chenyu Wang, Yufan Zhang +5
SlimPack: Fine-Grained Asymmetric Packing for Balanced and Efficient Variable-Length LLM Training
Yuliang Liu, Guohao Wu, Shenglong Zhang +4
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
Linger Deng, Linghao Zhu, Yuliang Liu +6
Context-level Language Modeling by Learning Predictive Context Embeddings
Beiya Dai, Yuliang Liu, Daozheng Xue +6
PROBE: Co-Balancing Computation and Communication in MoE Inference via Real-Time Predictive Prefetching
Qianchao Zhu, Xucheng Ye, Yuliang Liu +2
ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning
Chao Jin, Xinming Wei, Yinmin Zhong +6
GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving
Linger Deng, Yuliang Liu, Wenwen Yu +4
SAPA: Similarity-Aware Point Affiliation for Feature Upsampling
Hao Lu, Wenze Liu, Zixuan Ye +3
Deciphering Oracle Bone Language with Diffusion Models
Haisu Guan, Huanxin Yang, Xinyu Wang +5
Omnidirectional Scene Text Detection with Sequential-free Box Discretization
Yuliang Liu, Sheng Zhang, Lianwen Jin +3
Kling-Omni Technical Report
Kling Team, Jialu Chen, Yuanzheng Ci +65
Accountable Textual-Visual Chat Learns to Reject Human Instructions in Image Re-creation
Zhiwei Zhang, Yuliang Liu
ExpertPlex: A High-Goodput Disaggregated Serving System for MoE LLMs with Adaptive Persistent Kernels
Bingyang Wu, Chao Jin, Zili Zhang +6
Progressive Evolution from Single-Point to Polygon for Scene Text
Linger Deng, Mingxin Huang, Xudong Xie +3
Separating Content from Style Using Adversarial Learning for Recognizing Text in the Wild
Canjie Luo, Qingxiang Lin, Yuliang Liu +2
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
Jingqun Tang, Qi Liu, Yongjie Ye +14
ICDAR 2023 Competition on Structured Text Extraction from Visually-Rich Document Images
Wenwen Yu, Chengquan Zhang, Haoyu Cao +24
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
Liang Yin, Xudong Xie, Zhang Li +2
Training-free Geometric Image Editing on Diffusion Models
Hanshen Zhu, Zhen Zhu, Kaile Zhang +3
Box-DETR: Understanding and Boxing Conditional Spatial Queries
Wenze Liu, Hao Lu, Yuliang Liu +1
Transport Properties of a Quantum Dot Restudied by Algebraic Equation of Motion
Jiangqi Mao, Houmin Du, Yuliang Liu
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
Hao Yan, Xingchen Liu, Hao Wang +11
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
Wenwen Yu, Zhibo Yang, Yuliang Liu +1
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
Jianqiang Wan, Sibo Song, Wenwen Yu +6
SPTS v2: Single-Point Scene Text Spotting
Yuliang Liu, Jiaxin Zhang, Dezhi Peng +8
Colossal-AI: A Unified Deep Learning System For Large-Scale Parallel Training
Shenggui Li, Hongxin Liu, Zhengda Bian +5
SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training
Zhouyang Li, Yuliang Liu, Wei Zhang +4
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
Yuliang Liu, Biao Yang, Qiang Liu +4
Toward Real Text Manipulation Detection: New Dataset and New Solution
Dongliang Luo, Yuliang Liu, Rui Yang +4
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
Yiran Guan, Sifan Tu, Dingkang Liang +6
Aggregation Cross-Entropy for Sequence Recognition
Zecheng Xie, Yaoxiong Huang, Yuanzhi Zhu +3
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
Yiran Guan, Liang Yin, Dingkang Liang +5
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
An-Lan Wang, Jingqun Tang, Liao Lei +10
MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
Jiarui Zhang, Yuliang Liu, Zijun Wu +17
The First Swahili Language Scene Text Detection and Recognition Dataset
Fadila Wendigoundi Douamba, Jianjun Song, Ling Fu +2
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
Zhang Li, Yuliang Liu, Qiang Liu +8
AdaptiveStep: Automatically Dividing Reasoning Step through Model Confidence
Yuliang Liu, Junjie Lu, Zhaoling Chen +10
TokBench: Evaluating Your Visual Tokenizer before Visual Generation
Junfeng Wu, Dongliang Luo, Weizhi Zhao +6
Atomic Coherence Assisted Multipartite Entanglement Generation with DELC Four-Wave Mixing
Yuliang Liu, Jiajia Wei, Mengqi Niu +7
Deep Matching Prior Network: Toward Tighter Multi-oriented Text Detection
Yuliang Liu, Lianwen Jin
Liquid: Language Models are Scalable and Unified Multi-modal Generators
Junfeng Wu, Yi Jiang, Chuofan Ma +5
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
Mingxin Huang, Yuliang Liu, Dingkang Liang +2
Hopf bifurcation analysis in a dual model of Internet congestion control algorithm with communication delay
Dawei Ding, Jie Zhu, Xiaoshu Luo +1
An open dataset for oracle bone script recognition and decipherment
Pengjie Wang, Kaile Zhang, Xinyu Wang +8
xHC: Expanded Hyper-Connections
Xiangdong Zhang, Xiaohan Qin, Sunan Zou +10
The paper introduces xHC, a method that expands the residual stream of Transformers to many parallel streams using temporal feature augmentation and a sparse update scheme, enablin…
VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization
Yuliang Liu, Mingxin Huang, Hao Yan +6
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
Zhang Li, Zhibo Lin, Qiang Liu +7
A Probability Space at Inception of Stochastic Process
Liteng Yang, Yuliang Liu, Jing Liu +2
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
Xiangru Tang, Yuliang Liu, Zefan Cai +21
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
Mingxin Huang, Dezhi Peng, Hongliang Li +6
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
Yang Jin, Zhicheng Sun, Kun Xu +9
SwinTextSpotter: Scene Text Spotting via Better Synergy between Text Detection and Text Recognition
Mingxin Huang, Yuliang Liu, Zhenghao Peng +6
SPTS: Single-Point Text Spotting
Dezhi Peng, Xinyu Wang, Yuliang Liu +9
ESTextSpotter: Towards Better Scene Text Spotting with Explicit Synergy in Transformer
Mingxin Huang, Jiaxin Zhang, Dezhi Peng +5
Looking and Listening: Audio Guided Text Recognition
Wenwen Yu, Mingyu Liu, Biao Yang +5
ABCNet v2: Adaptive Bezier-Curve Network for Real-time End-to-end Text Spotting
Yuliang Liu, Chunhua Shen, Lianwen Jin +4
An open dataset for the evolution of oracle bone characters: EVOBC
Haisu Guan, Jinpeng Wan, Yuliang Liu +6
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
Linghao Zhu, Yiran Guan, Dingkang Liang +6
ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Network
Yuliang Liu, Hao Chen, Chunhua Shen +3
Heddle: A Distributed Orchestration System for Agentic RL Rollout
Zili Zhang, Yinmin Zhong, Chengxu Yang +5
MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks
Xingkui Zhu, Yiran Guan, Dingkang Liang +3
Colossal-Auto: Unified Automation of Parallelization and Activation Checkpoint for Large-scale Models
Yuliang Liu, Shenggui Li, Jiarui Fang +3
Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models
Yuliang Liu, Yunchong Song, Yixuan Wang +6
KwaiYiiMath: Technical Report
Jiayi Fu, Lei Lin, Xiaoyang Gao +18
Privacy-Preserving Biometric Verification with Handwritten Random Digit String
Peirong Zhang, Yuliang Liu, Songxuan Lai +2
ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT
Yipeng Sun, Zihan Ni, Chee-Kheng Chng +9
SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting
Dongliang Luo, Hanshen Zhu, Ziyang Zhang +4
On Point Affiliation in Feature Upsampling
Wenze Liu, Hao Lu, Yuliang Liu +1
ICDAR2019 Robust Reading Challenge on Arbitrary-Shaped Text (RRC-ArT)
Chee-Kheng Chng, Yuliang Liu, Yipeng Sun +11
Turning a CLIP Model into a Scene Text Spotter
Wenwen Yu, Yuliang Liu, Xingkui Zhu +3
Enhancing Scene Text Detectors with Realistic Text Image Synthesis Using Diffusion Models
Ling Fu, Zijie Wu, Yingying Zhu +2
MSDS: A Large-Scale Chinese Signature and Token Digit String Dataset for Handwriting Verification
Peirong Zhang, Jiajia Jiang, Yuliang Liu +1
MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
Yuliang Liu, Zhang Li, Ziyang Zhang +11
ICDAR 2023 Competition on Reading the Seal Title
Wenwen Yu, Mingyu Liu, Mingrui Chen +5
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
Yuliang Liu, Zhang Li, Mingxin Huang +7
DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models
Pengjie Wang, Linger Deng, Zujia Zhang +6
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
Hanshen Zhu, Yuliang Liu, Xuecheng Wu +7
Controlling Delay-induced Hopf bifurcation in Internet congestion control system
Dawei Ding, Jie Zhu, Xiaoshu Luo +1
Puzzle Pieces Picker: Deciphering Ancient Chinese Characters with Radical Reconstruction
Pengjie Wang, Kaile Zhang, Xinyu Wang +5
EnsNet: Ensconce Text in the Wild
Shuaitao Zhang, Yuliang Liu, Lianwen Jin +2
DeRPN: Taking a further step toward more general object detection
Lele Xie, Yuliang Liu, Lianwen Jin +1
AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning
Yuliang Liu, Haisu Guan, Pengjie Wang +11
PageNet: Towards End-to-End Weakly Supervised Page-Level Handwritten Chinese Text Recognition
Dezhi Peng, Lianwen Jin, Yuliang Liu +2
On the General Value of Evidence, and Bilingual Scene-Text Visual Question Answering
Xinyu Wang, Yuliang Liu, Chunhua Shen +6
BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training
Zili Zhang, Chengxu Yang, Shenglong Zhang +8
LongRecipe: Recipe for Efficient Long Context Generalization in Large Language Models
Zhiyuan Hu, Yuliang Liu, Jinman Zhao +8
Bridging the Gap Between End-to-End and Two-Step Text Spotting
Mingxin Huang, Hongliang Li, Yuliang Liu +2
Exploring the Capabilities of Large Multimodal Models on Dense Text
Shuo Zhang, Biao Yang, Zhang Li +3
ICDAR 2021 Competition on Integrated Circuit Text Spotting and Aesthetic Assessment
Chun Chet Ng, Akmalul Khairi Bin Nazaruddin, Yeong Khang Lee +6
Feature Enhancement Network: A Refined Scene Text Detector
Sheng Zhang, Yuliang Liu, Lianwen Jin +1
Tightness-aware Evaluation Protocol for Scene Text Detection
Yuliang Liu, Lianwen Jin, Zecheng Xie +3
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding
Hao Yan, Yuliang Liu, Xingchen Liu +5
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
Jingqun Tang, Chunhui Lin, Zhen Zhao +15
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
Xudong Xie, Hao Yan, Liang Yin +6
Exploring the Capacity of an Orderless Box Discretization Network for Multi-orientation Scene Text Detection
Yuliang Liu, Tong He, Hao Chen +5
Multimodal OCR: Parse Anything from Documents
Handong Zheng, Yumeng Li, Kaile Zhang +22
Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
Junjie Lu, Yuliang Liu, Chaofeng Qu +4
ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining
Dezhi Peng, Chongyu Liu, Yuliang Liu +1