2 papers
cs.CV2025
MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
Xuhui Zheng, Kang An, Ziliang Wang +3
Multimodal pre-training remains constrained by the descriptive bias of image-caption pairs, leading models to favor surface linguistic cues over grounded visual understanding. We i…
cs.CL2025
StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization
Ziliang Wang, Xuhui Zheng, Kang An +4
Efficient multi-hop reasoning requires Large Language Models (LLMs) based agents to acquire high-value external knowledge iteratively. Previous work has explored reinforcement lear…