12 papers
A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems
Hao Zhang, Jiaxin Qi, Zhijiang Tang +1
As Large Vision-Language Models increasingly aim to integrate visual generation and understanding within a single parameter space, evaluating such structural unification in a cohes…
A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions
Zhijiang Tang, Jiaxin Qi, Kaihua Tang +2
Image captioning is a primary task in vision--language research, yet assessing how faithfully a caption preserves image semantics without relying on reference captions remains unse…
Spatial Transcriptomics as Images for Large-Scale Pretraining
Yishun Zhu, Jiaxin Qi, Jian Wang +2
Spatial Transcriptomics (ST) profiles thousands of gene expression values at discrete spots with precise coordinates on tissue sections, preserving spatial context essential for cl…
Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents
Han Chi, Jiaxin Qi, Yan Cui +2
Rapid advances in large language models have improved the task-solving capabilities of command-line-interface (CLI)-based agents, whose CLIs determine how models invoke tools, main…
Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation
Zhijiang Tang, Jiaxin Qi, Bing Zhao +1
As video generation models achieve unprecedented capabilities, the demand for robust video evaluation metrics becomes increasingly critical. Traditional metrics are intrinsically t…
In Search of Lost DNA Sequence Pretraining
Zhijiang Tang, Jiaxin Qi, Yan Cui +3
DNA sequence encoding is fundamental to gene function prediction, protein synthesis, and diverse downstream biological tasks. Despite the substantial progress achieved by large-sca…