NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (35)

cs.CV2025

Ovis-Image Technical Report

Guo-Hua Wang, Liangfu Cao, Tianyu Cui +8

cs.CV2025

PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm

Tianyu Chang, Xiaohao Chen, Zhichao Wei +5

cs.CV2025

CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation

Minghao Fu, Guo-Hua Wang, Liangfu Cao +4

cs.LG2020

Deep Time-Stream Framework for Click-Through Rate Prediction by Tracking Interest Evolution

Shu-Ting Shi, Wenhao Zheng, Jun Tang +4

cs.CV2024

Ovis: Structural Embedding Alignment for Multimodal Large Language Model

Shiyin Lu, Yang Li, Qing-Guo Chen +4

cs.CV2026

Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images

JiaKui Hu, Shanshan Zhao, Qing-Guo Chen +6

cs.CV2025

Evaluating Image Caption via Cycle-consistent Text-to-Image Generation

Tianyu Cui, Jinbin Bai, Guo-Hua Wang +5

cs.LG2025

Multimodal Tabular Reasoning with Privileged Structured Information

Jun-Peng Jiang, Yu Xia, Hai-Long Sun +6

cs.AI2025

MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning

Dawei Yan, Yang Li, Qing-Guo Chen +4

cs.CL2025

Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees

Sijia Chen, Yibo Wang, Yi-Feng Wu +5

cs.CV2025

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia +39

cs.CV2025

Multi-Label Test-Time Adaptation with Bound Entropy Minimization

Xiangyu Wu, Feng Yu, Qing-Guo Chen +2

cs.CV2024

TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt

Xiangyu Wu, Qing-Yuan Jiang, Yang Yang +3

cs.CV2025

Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models

Minghao Fu, Guo-Hua Wang, Tianyu Cui +4

cs.CV2026

OvisOCR2 Technical Report

Shiyin Lu, Yinglun Li, Yu Xia +10

OvisOCR2 is a 0.8 B parameter end‑to‑end model that converts document page images into Markdown, handling text, formulas, tables, and visual regions, and achieves state‑of‑the‑art…

#document parsing#end-to-end OCR#markdown generation#synthetic data augmentation
cs.LG2026

LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

Jiaqi Tang, Yu Xia, Yi-Feng Wu +9

cs.CV2026

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

Wenhao Yang, Yu Xia, Jinlong Huang +10

cs.CV2026

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

Shanshan Zhao, Xinjie Zhang, Jintao Guo +9

cs.CV2024

UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation

Lunhao Duan, Shanshan Zhao, Wenjun Yan +7

cs.CV2025

Parrot: Multilingual Visual Instruction Tuning

Hai-Long Sun, Da-Wei Zhou, Yang Li +8

cs.CV2026

Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation

Xiangyu Wu, Dongming Jiang, Feng Yu +5

cs.CV2025

MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs

Hui Sun, Shiyin Lu, Huanyu Wang +5

cs.CV2025

TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance

Minghao Fu, Guo-Hua Wang, Xiaohao Chen +4

cs.CV2020

Multi-label Zero-shot Classification by Learning to Transfer from External Knowledge

He Huang, Yuanwei Chen, Wei Tang +4

cs.CV2026

Training-Free Image Editing with Visual Context Integration and Concept Alignment

Rui Song, Guo-Hua Wang, Qing-Guo Chen +6

cs.CV2026

Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images

Wenhao Yang, Yu Xia, Jinlong Huang +7

cs.CV2026

M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

Dawei Yan, Haokui Zhang, Guangda Huzhang +8

cs.CL2024

Wings: Learning Multimodal LLMs without Text-only Forgetting

Yi-Kai Zhang, Shiyin Lu, Yang Li +7

cs.CV2025

Ovis-U1 Technical Report

Guo-Hua Wang, Shanshan Zhao, Xinjie Zhang +9

cs.CL2024

OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions

Yi-Kai Zhang, Xu-Xiang Zhong, Shiyin Lu +3

cs.CL2026

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

Sensen Gao, Shanshan Zhao, Xu Jiang +7

cs.IR2022

Sparse Attentive Memory Network for Click-through Rate Prediction with Long Sequences

Qianying Lin, Wen-Ji Zhou, Yanshi Wang +3

cs.AI2026

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

Yibo Wang, Guangda Huzhang, Yuwei Hu +7

cs.LG2025

SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models

Yibo Wang, Qing-Guo Chen, Zhao Xu +3

cs.CL2026

Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs

Yibo Wang, Hai-Long Sun, Qing-Guo Chen +4