Publications (49)
Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
Chaoyang Wang, Yangfan He, Yiyang Zhou +6
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
Jiabing Yang, Chenhang Cui, Yiyang Zhou +6
Labels Are Not Perfect: Inferring Spatial Uncertainty in Object Detection
Di Feng, Zining Wang, Yiyang Zhou +5
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
Xiyao Wang, Jiuhai Chen, Zhaoyang Wang +8
Anyprefer: An Agentic Framework for Preference Data Synthesis
Yiyang Zhou, Zhaoyang Wang, Tianle Wang +13
Reliable and Responsible Foundation Models: A Comprehensive Survey
Xinyu Yang, Junlin Han, Rishi Bommasani +49
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
Jiaqi Liu, Kaiwen Xiong, Peng Xia +6
GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?
Yiyang Zhou, Linjie Li, Shi Qiu +10
Center Feature Fusion: Selective Multi-Sensor Fusion of Center-based Objects
Philip Jacobson, Yiyang Zhou, Wei Zhan +2
What Matters for 3D Scene Flow Network
Guangming Wang, Yunzhe Hu, Zhe Liu +4
Evaluation and Analysis of Hallucination in Large Vision-Language Models
Junyang Wang, Yiyang Zhou, Guohai Xu +9
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
Peng Xia, Siwei Han, Shi Qiu +9
SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
Peng Xia, Jianwen Chen, Hanyang Wang +10
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
Zhaorun Chen, Yichao Du, Zichen Wen +16
Semantically Consistent Multi-view Representation Learning
Yiyang Zhou, Qinghai Zheng, Shunshun Bai +1
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
Yiyang Zhou, Haoqin Tu, Zijun Wang +11
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
Chenhang Cui, An Zhang, Yiyang Zhou +4
A Prefixed-Itemset-Based Improvement For Apriori Algorithm
Shoujian Yu, Yiyang Zhou
Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
Peng Xia, Kaide Zeng, Jiaqi Liu +5
MCoCo: Multi-level Consistency Collaborative Multi-view Clustering
Yiyang Zhou, Qinghai Zheng, Wenbiao Yan +3
DetMatch: Two Teachers are Better Than One for Joint 2D and 3D Semi-Supervised Object Detection
Jinhyung Park, Chenfeng Xu, Yiyang Zhou +2
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
Qinghao Ye, Haiyang Xu, Guohai Xu +15
Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery
Jiaqi Liu, Songning Lai, Pengze Li +12
Automatic Construction of Lane-level HD Maps for Urban Scenes
Yiyang Zhou, Yuichi Takeda, Masayoshi Tomizuka +1
Overlap Bias Matching is Necessary for Point Cloud Registration
Pengcheng Shi, Jie Zhang, Haozhe Cheng +4
MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
Haibo Tong, Zhaoyang Wang, Zhaorun Chen +11
UrbanLoco: A Full Sensor Suite Dataset for Mapping and Localization in Urban Scenes
Weisong Wen, Yiyang Zhou, Guohao Zhang +5
A Simple and Efficient Multi-task Network for 3D Object Detection and Road Understanding
Di Feng, Yiyang Zhou, Chenfeng Xu +2
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
Yiyang Zhou, Chenhang Cui, Rafael Rafailov +2
Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges
Chenhang Cui, Yiyang Zhou, Xinyu Yang +4
ClawArena: Benchmarking AI Agents in Evolving Information Environments
Haonian Ji, Kaiwen Xiong, Siwei Han +9
DualGenerator: Information Interaction-based Generative Network for Point Cloud Completion
Pengcheng Shi, Haozhe Cheng, Xu Han +2
Calibrated Self-Rewarding Vision Language Models
Yiyang Zhou, Zhiyuan Fan, Dongjie Cheng +7
Contrastive Label Enhancement
Yifei Wang, Yiyang Zhou, Jihua Zhu +3
VHELM: A Holistic Evaluation of Vision Language Models
Tony Lee, Haoqin Tu, Chi Heem Wong +8
Multi-view Semantic Consistency based Information Bottleneck for Clustering
Wenbiao Yan, Jihua Zhu, Yiyang Zhou +2
Inferring Spatial Uncertainty in Object Detection
Zining Wang, Di Feng, Yiyang Zhou +5
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
Peng Xia, Ze Chen, Juanxi Tian +21
Semantic-Human: Neural Rendering of Humans from Monocular Video with Human Parsing
Jie Zhang, Pengcheng Shi, Zaiwang Gu +2
SST-Calib: Simultaneous Spatial-Temporal Parameter Calibration between LIDAR and Camera
Akio Kodaira, Yiyang Zhou, Pengwei Zang +2
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
Yiyang Zhou, Yangfan He, Yaofeng Su +5
How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs
Haoqin Tu, Chenhang Cui, Zijun Wang +6
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
Yiyang Zhou, Chenhang Cui, Jaehong Yoon +5
Not All Skills Help: Measuring and Repairing Agent Knowledge
Yixuan Wang, Yiyang Zhou, Yiming Liang +4
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
Yiming Liang, Yixiao Chen, Yiyang Zhou +8
Improving Alignment in LVLMs with Debiased Self-Judgment
Sihan Yang, Chenhang Cui, Zihao Zhao +4
SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read
Yibo Peng, Peng Xia, Ding Zhong +6
VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation
Qijun Han, Haoqin Tu, Zijun Wang +11
Target-Oriented Pretraining Data Selection via Neuron-Activated Graph
Zijun Wang, Haoqin Tu, Weidong Zhou +7