collaborators

14 papers

cs.CV2026

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

Hao Zhang, Jiaxin Qi, Zhijiang Tang +1

As Large Vision-Language Models increasingly aim to integrate visual generation and understanding within a single parameter space, evaluating such structural unification in a cohes…

cs.LG2026

Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views

Jiaqi Xiong, Yuntao hu, Yu Zheng +3

The rapid growth of single-cell transcriptomic data has enabled the development of foundation models pretrained primarily by reconstructing masked expression values. This objective…

cs.CV2026

A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions

Zhijiang Tang, Jiaxin Qi, Kaihua Tang +2

Image captioning is a primary task in vision--language research, yet assessing how faithfully a caption preserves image semantics without relying on reference captions remains unse…

cs.CV2026

Spatial Transcriptomics as Images for Large-Scale Pretraining

Yishun Zhu, Jiaxin Qi, Jian Wang +2

Spatial Transcriptomics (ST) profiles thousands of gene expression values at discrete spots with precise coordinates on tissue sections, preserving spatial context essential for cl…

cs.SE2026

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

Han Chi, Jiaxin Qi, Yan Cui +2

Rapid advances in large language models have improved the task-solving capabilities of command-line-interface (CLI)-based agents, whose CLIs determine how models invoke tools, main…

cs.CV2026

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

Jiayu Li, Jiaxin Qi, Sheng Zhou +2

Contrastive vision-language models like CLIP exhibit remarkable zero-shot generalization. However, prompt tuning remains highly sensitive to label noise, as mislabeled samples gene…