papers

Publications (47)

cs.CV2026

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

Daixian Liu, Jiayi Kuang, Yinghui Li +8

cs.SE2026

EvoConfig: Self-Evolving Multi-Agent Systems for Efficient Autonomous Environment Configuration

Xinshuai Guo, Jiayi Kuang, Linyue Pan +6

cs.CV2023

A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise

Chaoyou Fu, Renrui Zhang, Zihan Wang +15

cs.AI2026

TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning

Mingze Xu, Yinghui Li, Jiayi Kuang +5

TopoAgent introduces a graph‑based, self‑evolving framework that breaks down multimodal scientific queries into visual atoms and organizes them in a DAG, allowing dynamic refinemen…

#multimodal reasoning#graph planning#scientific reasoning#large language models
cs.CV2026

Youtu-VL: Unleashing Visual Potential via Unified Vision-Language Supervision

Zhixiang Wei, Yi Li, Zhehan Kan +38

cs.AI2025

Tell Me What You Don't Know: Enhancing Refusal Capabilities of Role-Playing Agents via Representation Space Analysis and Editing

Wenhao Liu, Siyu An, Junru Lu +8

physics.soc-ph2019

A novel metric for community detection

Ke-ke Shang, Michael Small, Yan Wang +2

cs.CV2026

Toward Native Multimodal Modeling: A Roadmap

Siyu An, Junru Lu, Junnan Dong +18

cs.CL2025

CoDiEmb: A Collaborative yet Distinct Framework for Unified Representation Learning in Information Retrieval and Semantic Textual Similarity

Bowen Zhang, Zixin Song, Chunquan Chen +3

cs.CE2024

FinVerse: An Autonomous Agent System for Versatile Financial Analysis

Siyu An, Qin Li, Junru Lu +2

cs.CL2022

RAAT: Relation-Augmented Attention Transformer for Relation Modeling in Document-Level Event Extraction

Yuan Liang, Zhuoxuan Jiang, Di Yin +1

cs.CV2025

VITA: Towards Open-Source Interactive Omni Multimodal LLM

Chaoyou Fu, Haojia Lin, Zuwei Long +16

cs.AI2025

CRISPR-GPT for Agentic Automation of Gene-editing Experiments

Yuanhao Qu, Kaixuan Huang, Ming Yin +11

cs.CL2025

RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following

Junru Lu, Jiazheng Li, Guodong Shen +5

cs.IR2024

VKIE: The Application of Key Information Extraction on Video Text

Siyu An, Ye Liu, Haoyuan Peng +1

cs.IR2025

Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning

Junnan Dong, Siyu An, Yifei Yu +6

cs.LG2026

HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention

Yufei Xu, Fanxu Meng, Fan Jiang +11

cs.SE2025

Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents

Jiayi Kuang, Yinghui Li, Xin Zhang +5

cs.CL2024

FIPO: Free-form Instruction-oriented Prompt Optimization with Preference Dataset and Modular Fine-tuning Schema

Junru Lu, Siyu An, Min Zhang +3

cs.AI2025

LabOS: The AI-XR Co-Scientist That Sees and Works With Humans

Le Cong, David Smerkous, Xiaotong Wang +30

cs.CV2023

Rethinking Data Perturbation and Model Stabilization for Semi-supervised Medical Image Segmentation

Zhen Zhao, Ye Liu, Meng Zhao +3

cs.CL2022

Leveraging Key Information Modeling to Improve Less-Data Constrained News Headline Generation via Duality Fine-Tuning

Zhuoxuan Jiang, Lingfeng Qiao, Di Yin +2

cs.CL2026

Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models

Junru Lu, Jiarui Qin, Lingfeng Qiao +35

cs.CL2024

Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence

Junru Lu, Jiazheng Li, Siyu An +4

cs.CL2025

Let's Be Self-generated via Step by Step: A Curriculum Learning Approach to Automated Reasoning with Large Language Models

Kangyang Luo, Zichen Ding, Zhenmin Weng +5

cs.CL2026

SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space

Zhenyi Shen, Junru Lu, Lin Gui +4

cs.CL2024

SNFinLLM: Systematic and Nuanced Financial Domain Adaptation of Chinese Large Language Models

Shujuan Zhao, Lingfeng Qiao, Kangyang Luo +3

cs.CL2025

Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts

Yifei Yu, Qian-Wen Zhang, Lingfeng Qiao +7

cs.AI2026

Deep Tabular Research via Continual Experience-Driven Execution

Junnan Dong, Chuang Zhou, Zheng Yuan +7

cs.CV2022

OS-MSL: One Stage Multimodal Sequential Link Framework for Scene Segmentation and Classification

Ye Liu, Lingfeng Qiao, Di Yin +4

cs.AI2026

From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

Yongheng Zhang, Ziang Liu, Jiaxuan Zhu +17

cs.AI2025

APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

Jiarui Qin, Yunjia Xi, Junjie Huang +6

cs.CL2026

ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution

Junjie Huang, Jiarui Qin, Di Yin +4

physics.soc-ph2019

The key to the weak-ties phenomenon

Ke-ke Shang, Michael Small, Di Yin +2

cs.CL2026

MoG: Mixture of Experts for Graph-based Retrieval-Augmented Generation

Zheng Yuan, Chuang Zhou, Linhao Luo +4

cs.CV2026

Latent Visual Cache for Video Reasoning

Yongheng Zhang, Zhipeng Xu, Hao Wu +4

cs.CV2022

Grafting Pre-trained Models for Multimodal Headline Generation

Lingfeng Qiao, Chen Wu, Ye Liu +3

cs.CL2025

FactGuard: Leveraging Multi-Agent Systems to Generate Answerable and Unanswerable Questions for Enhanced Long-Context LLM Extraction

Qian-Wen Zhang, Fang Li, Jie Wang +4

cs.CL2025

GraphRAG-Bench: Challenging Domain-Specific Reasoning for Evaluating Graph Retrieval-Augmented Generation

Yilin Xiao, Junnan Dong, Chuang Zhou +5

cs.CL2023

MemoChat: Tuning LLMs to Use Memos for Consistent Long-Range Open-Domain Conversation

Junru Lu, Siyu An, Mingbao Lin +5

cs.CL2022

Unsupervised Extractive Summarization with Heterogeneous Graph Embeddings for Chinese Document

Chen Lin, Ye Liu, Siyu An +1

cs.CV2022

Contrastive Graph Multimodal Model for Text Classification in Videos

Ye Liu, Changchong Lu, Chen Lin +2

cs.CL2025

MAC-SQL: A Multi-Agent Collaborative Framework for Text-to-SQL

Bing Wang, Changyu Ren, Jian Yang +8

cs.CV2026

Thinking in Video: Can Video Generators Really Reason About the Real World?

Yongheng Zhang, Guang Yang, Ruihan Hou +12

cs.CL2026

PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity

Zixin Song, Bowen Zhang, Qian-Wen Zhang +3

cs.AI2024

CJEval: A Benchmark for Assessing Large Language Models Using Chinese Junior High School Exam Data

Qian-Wen Zhang, Haochen Wang, Fang Li +5

cs.LG2025

TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference

Xiaojuan Tang, Fanxu Meng, Pingzhi Tang +4