Showing cs.CVShow all
2 papers · 1 filter
cs.CV2026
The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space
Xia Hu, Zhenrui Yue, Brian Potetz +4
As current Multimodal Large Language Models rapidly saturate canonical visual reasoning benchmarks, a key question emerges: do these strong scores genuinely reflect robust visual u…
cs.CV2025
Wave-Particle (Continuous-Discrete) Dualistic Visual Tokenization for Unified Understanding and Generation
Yizhu Chen, Chen Ju, Zhicheng Wang +5
The unification of understanding and generation within a single multi-modal large model (MLLM) remains one significant challenge, largely due to the dichotomy between continuous an…