14 papers
A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems
Hao Zhang, Jiaxin Qi, Zhijiang Tang +1
As Large Vision-Language Models increasingly aim to integrate visual generation and understanding within a single parameter space, evaluating such structural unification in a cohes…
Beyond Gene Reconstruction: Learning Cell Representations through Complementary Transcriptomic Views
Jiaqi Xiong, Yuntao hu, Yu Zheng +3
The rapid growth of single-cell transcriptomic data has enabled the development of foundation models pretrained primarily by reconstructing masked expression values. This objective…
A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions
Zhijiang Tang, Jiaxin Qi, Kaihua Tang +2
Image captioning is a primary task in vision--language research, yet assessing how faithfully a caption preserves image semantics without relying on reference captions remains unse…
Spatial Transcriptomics as Images for Large-Scale Pretraining
Yishun Zhu, Jiaxin Qi, Jian Wang +2
Spatial Transcriptomics (ST) profiles thousands of gene expression values at discrete spots with precise coordinates on tissue sections, preserving spatial context essential for cl…
Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents
Han Chi, Jiaxin Qi, Yan Cui +2
Rapid advances in large language models have improved the task-solving capabilities of command-line-interface (CLI)-based agents, whose CLIs determine how models invoke tools, main…
Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models
Jiayu Li, Jiaxin Qi, Sheng Zhou +2
Contrastive vision-language models like CLIP exhibit remarkable zero-shot generalization. However, prompt tuning remains highly sensitive to label noise, as mislabeled samples gene…