collaborators

12 papers

cs.CV2026

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

Hao Zhang, Jiaxin Qi, Zhijiang Tang +1

As Large Vision-Language Models increasingly aim to integrate visual generation and understanding within a single parameter space, evaluating such structural unification in a cohes…

cs.CV2026

A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions

Zhijiang Tang, Jiaxin Qi, Kaihua Tang +2

Image captioning is a primary task in vision--language research, yet assessing how faithfully a caption preserves image semantics without relying on reference captions remains unse…

cs.CV2026

Spatial Transcriptomics as Images for Large-Scale Pretraining

Yishun Zhu, Jiaxin Qi, Jian Wang +2

Spatial Transcriptomics (ST) profiles thousands of gene expression values at discrete spots with precise coordinates on tissue sections, preserving spatial context essential for cl…

cs.SE2026

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

Han Chi, Jiaxin Qi, Yan Cui +2

Rapid advances in large language models have improved the task-solving capabilities of command-line-interface (CLI)-based agents, whose CLIs determine how models invoke tools, main…

cs.CV2026

Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation

Zhijiang Tang, Jiaxin Qi, Bing Zhao +1

As video generation models achieve unprecedented capabilities, the demand for robust video evaluation metrics becomes increasingly critical. Traditional metrics are intrinsically t…

cs.LG2026

In Search of Lost DNA Sequence Pretraining

Zhijiang Tang, Jiaxin Qi, Yan Cui +3

DNA sequence encoding is fundamental to gene function prediction, protein synthesis, and diverse downstream biological tasks. Despite the substantial progress achieved by large-sca…