4 papers
DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
Le Xiang, Zhicheng Guan, Hong Chen +5
Long Document Visual Question Answering (LongDocVQA) requires Multimodal Large Language Models (MLLMs) to locate, integrate, and reason over heterogeneous document elements distrib…
Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval
Zhucun Xue, Jiangning Zhang, Juntao Jiang +6
The rapid expansion of research across machine learning, vision, and language has produced a volume of publications that is increasingly difficult to synthesize. Traditional biblio…
ERNIE 5.0 Technical Report
Haifeng Wang, Hua Wu, Tian Wu +432
In this report, we introduce ERNIE 5.0, a natively autoregressive foundation model desinged for unified multimodal understanding and generation across text, image, video, and audio…
Photonic implementation of quantum hidden subgroup database compression
Qianyi Wang, Feiyang Liu, Teng Hu +6
We experimentally demonstrate quantum data compression exploiting hidden subgroup symmetries using a photonic quantum processor. Classical databases containing generalized periodic…