NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (49)

cs.CV2025

Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs

Chaoyang Wang, Yangfan He, Yiyang Zhou +6

cs.CV2025

IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models

Jiabing Yang, Chenhang Cui, Yiyang Zhou +6

cs.CV2020

Labels Are Not Perfect: Inferring Spatial Uncertainty in Object Detection

Di Feng, Zining Wang, Yiyang Zhou +5

cs.CV2025

Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement

Xiyao Wang, Jiuhai Chen, Zhaoyang Wang +8

cs.LG2025

Anyprefer: An Agentic Framework for Preference Data Synthesis

Yiyang Zhou, Zhaoyang Wang, Tianle Wang +13

cs.LG2026

Reliable and Responsible Foundation Models: A Comprehensive Survey

Xinyu Yang, Junlin Han, Rishi Bommasani +49

cs.CV2025

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Jiaqi Liu, Kaiwen Xiong, Peng Xia +6

cs.CV2025

GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?

Yiyang Zhou, Linjie Li, Shi Qiu +10

cs.CV2023

Center Feature Fusion: Selective Multi-Sensor Fusion of Center-based Objects

Philip Jacobson, Yiyang Zhou, Wei Zhan +2

cs.CV2022

What Matters for 3D Scene Flow Network

Guangming Wang, Yunzhe Hu, Zhe Liu +4

cs.LG2023

Evaluation and Analysis of Hallucination in Large Vision-Language Models

Junyang Wang, Yiyang Zhou, Guohai Xu +9

cs.CV2025

MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models

Peng Xia, Siwei Han, Shi Qiu +9

cs.LG2026

SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning

Peng Xia, Jianwen Chen, Hanyang Wang +10

cs.CV2024

MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?

Zhaorun Chen, Yichao Du, Zichen Wen +16

cs.LG2023

Semantically Consistent Multi-view Representation Learning

Yiyang Zhou, Qinghai Zheng, Shunshun Bai +1

cs.CV2025

When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought

Yiyang Zhou, Haoqin Tu, Zijun Wang +11

cs.CV2025

Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment

Chenhang Cui, An Zhang, Yiyang Zhou +4

cs.DS2016

A Prefixed-Itemset-Based Improvement For Apriori Algorithm

Shoujian Yu, Yiyang Zhou

cs.LG2025

Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning

Peng Xia, Kaide Zeng, Jiaqi Liu +5

cs.LG2023

MCoCo: Multi-level Consistency Collaborative Multi-view Clustering

Yiyang Zhou, Qinghai Zheng, Wenbiao Yan +3

cs.CV2022

DetMatch: Two Teachers are Better Than One for Joint 2D and 3D Semi-Supervised Object Detection

Jinhyung Park, Chenfeng Xu, Yiyang Zhou +2

cs.CL2024

mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality

Qinghao Ye, Haiyang Xu, Guohai Xu +15

cs.AI2025

Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery

Jiaqi Liu, Songning Lai, Pengze Li +12

cs.RO2021

Automatic Construction of Lane-level HD Maps for Urban Scenes

Yiyang Zhou, Yuichi Takeda, Masayoshi Tomizuka +1

cs.CV2023

Overlap Bias Matching is Necessary for Point Cloud Registration

Pengcheng Shi, Jie Zhang, Haozhe Cheng +4

cs.CV2025

MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation

Haibo Tong, Zhaoyang Wang, Zhaorun Chen +11

cs.RO2020

UrbanLoco: A Full Sensor Suite Dataset for Mapping and Localization in Urban Scenes

Weisong Wen, Yiyang Zhou, Guohao Zhang +5

cs.CV2021

A Simple and Efficient Multi-task Network for 3D Object Detection and Road Understanding

Di Feng, Yiyang Zhou, Chenfeng Xu +2

cs.LG2024

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Yiyang Zhou, Chenhang Cui, Rafael Rafailov +2

cs.LG2023

Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges

Chenhang Cui, Yiyang Zhou, Xinyu Yang +4

cs.LG2026

ClawArena: Benchmarking AI Agents in Evolving Information Environments

Haonian Ji, Kaiwen Xiong, Siwei Han +9

cs.CV2023

DualGenerator: Information Interaction-based Generative Network for Point Cloud Completion

Pengcheng Shi, Haozhe Cheng, Xu Han +2

cs.LG2024

Calibrated Self-Rewarding Vision Language Models

Yiyang Zhou, Zhiyuan Fan, Dongjie Cheng +7

cs.LG2023

Contrastive Label Enhancement

Yifei Wang, Yiyang Zhou, Jihua Zhu +3

cs.CV2024

VHELM: A Holistic Evaluation of Vision Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong +8

cs.LG2023

Multi-view Semantic Consistency based Information Bottleneck for Clustering

Wenbiao Yan, Jihua Zhu, Yiyang Zhou +2

cs.CV2020

Inferring Spatial Uncertainty in Object Detection

Zining Wang, Di Feng, Yiyang Zhou +5

cs.LG2024

CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models

Peng Xia, Ze Chen, Juanxi Tian +21

cs.CV2023

Semantic-Human: Neural Rendering of Humans from Monocular Video with Human Parsing

Jie Zhang, Pengcheng Shi, Zaiwang Gu +2

cs.CV2022

SST-Calib: Simultaneous Spatial-Temporal Parameter Calibration between LIDAR and Camera

Akio Kodaira, Yiyang Zhou, Pengwei Zang +2

cs.CV2025

ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding

Yiyang Zhou, Yangfan He, Yaofeng Su +5

cs.CV2023

How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs

Haoqin Tu, Chenhang Cui, Zijun Wang +6

cs.LG2024

Analyzing and Mitigating Object Hallucination in Large Vision-Language Models

Yiyang Zhou, Chenhang Cui, Jaehong Yoon +5

cs.CL2026

Not All Skills Help: Measuring and Repairing Agent Knowledge

Yixuan Wang, Yiyang Zhou, Yiming Liang +4

cs.CV2026

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

Yiming Liang, Yixiao Chen, Yiyang Zhou +8

cs.CV2025

Improving Alignment in LVLMs with Debiased Self-Judgment

Sihan Yang, Chenhang Cui, Zihao Zhao +4

cs.CV2026

SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read

Yibo Peng, Peng Xia, Ding Zhong +6

cs.CL2026

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

Qijun Han, Haoqin Tu, Zijun Wang +11

cs.CL2026

Target-Oriented Pretraining Data Selection via Neuron-Activated Graph

Zijun Wang, Haoqin Tu, Weidong Zhou +7