NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (39)

cs.CV2025

DanceGRPO: Unleashing GRPO on Visual Generation

Zeyue Xue, Jie Wu, Yu Gao +8

cs.SD2026

EvA: An Evidence-First Audio Understanding Paradigm for LALMs

Xinyuan Xie, Shunian Chen, Zhiheng Liu +4

cs.CV2023

Cones: Concept Neurons in Diffusion Models for Customized Generation

Zhiheng Liu, Ruili Feng, Kai Zhu +6

cs.LG2025

Scaling Law for Quantization-Aware Training

Mengzhao Chen, Chaoyi Zhang, Jing Liu +8

cs.SD2026

WavFlow: Audio Generation in Waveform Space

Feiyan Zhou, Luyuan Wang, Shoufa Chen +6

eess.SP2025

Fuzzy Clustering for Low-Complexity Time Domain Chromatic Dispersion Compensation Scheme in Coherent Optical Fiber Communication Systems

Wenkai Wan, Aiying Yang, Peng Guo +4

cs.CV2024

ViViD: Video Virtual Try-on using Diffusion Models

Zixun Fang, Wei Zhai, Aimin Su +7

math.CO2017

On Continuity Properties for Infinite Rectangle Packing

Zhiheng Liu

cs.AI2026

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

Haotian Liang, Mingkang Chen, Yufei Huang +27

The paper introduces RxBrain, a foundation model that jointly reasons over language and visual inputs to create embodied plans, using a multimodal Mixture-of-Transformers architect…

#embodied cognition#multimodal reasoning#language-visual planning#foundation models
cs.CV2025

MagicQuill: An Intelligent Interactive Image Editing System

Zichen Liu, Yue Yu, Hao Ouyang +6

cs.CV2025

UniPaint: Unified Space-time Video Inpainting via Mixture-of-Experts

Zhen Wan, Chenyang Qi, Zhiheng Liu +2

cs.CV2025

Scaling Zero-Shot Reference-to-Video Generation

Zijian Zhou, Shikun Liu, Haozhe Liu +14

cs.CL2025

From Denoising to Refining: A Corrective Framework for Vision-Language Diffusion Model

Yatai Ji, Teng Wang, Yuying Ge +4

cs.CV2023

LivePhoto: Real Image Animation with Text-guided Motion Control

Xi Chen, Zhiheng Liu, Mengting Chen +4

cs.CV2025

ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models

Zixun Fang, Kai Zhu, Zhiheng Liu +4

cs.CV2022

Self-Paced Imbalance Rectification for Class Incremental Learning

Zhiheng Liu, Kai Zhu, Yang Cao

cs.CV2025

WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception

Zhiheng Liu, Xueqing Deng, Shoufa Chen +7

cs.CL2025

ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine

Junying Chen, Zhenyang Cai, Zhiheng Liu +10

cs.CL2026

VecGlypher: Unified Vector Glyph Generation with Language Models

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng +12

cs.CV2024

InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior

Zhiheng Liu, Hao Ouyang, Qiuyu Wang +7

cs.CV2025

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

Zhiheng Liu, Weiming Ren, Haozhe Liu +22

cs.AI2024

Zodiac: A Cardiologist-Level LLM Framework for Multi-Agent Diagnostics

Yuan Zhou, Peng Zhang, Mengya Song +5

cs.CV2023

CCM: Adding Conditional Controls to Text-to-Image Consistency Models

Jie Xiao, Kai Zhu, Han Zhang +5

cs.CV2026

DepthLab: From Partial to Complete

Zhiheng Liu, Ka Leong Cheng, Qiuyu Wang +7

cs.CV2025

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

Zhaochong An, Menglin Jia, Haonan Qiu +12

cs.CV2025

AniDoc: Animation Creation Made Easier

Yihao Meng, Hao Ouyang, Hanlin Wang +6

cs.LG2025

INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats

Mengzhao Chen, Meng Wu, Hui Jin +10

cs.AI2024

The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control

Ruili Feng, Han Zhang, Zhantao Yang +7

cs.GT2014

A Game-Theoretic Approach to Energy-Efficient Resource Allocation in Device-to-Device Underlay Communications

Zhenyu Zhou, Mianxiong Dong, Kaoru Ota +3

cs.CL2026

Kimi K3: Open Frontier Intelligence

Kimi Team, Tongtong Bai, Yifan Bai +398

cs.CL2025

Soundwave: Less is More for Speech-Text Alignment in LLMs

Yuhao Zhang, Zhiheng Liu, Fan Bu +3

cs.CV2025

VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization

Zixun Fang, Zhiheng Liu, Kai Zhu +5

cs.CV2026

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

Zhiheng Liu, Weiming Ren, Xiaoke Huang +12

cs.CV2025

MangaNinja: Line Art Colorization with Precise Reference Following

Zhiheng Liu, Ka Leong Cheng, Xi Chen +7

cs.CV2023

DreamVideo: Composing Your Dream Videos with Customized Subject and Motion

Yujie Wei, Shiwei Zhang, Zhiwu Qing +6

cs.CV2023

Cones 2: Customizable Image Synthesis with Multiple Subjects

Zhiheng Liu, Yifei Zhang, Yujun Shen +7

cs.SE2026

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

Shoufa Chen, Luyuan Wang, Xuan Yang +7

cs.RO2026

See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation

Tingjun Dai, Mingfei Han, Tingwen Du +6

cs.CV2025

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

Haonan Qiu, Shikun Liu, Zijian Zhou +10