3 citations · 3 across the 1 of their papers we have counts for
3 papers
cs.CV2026
Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces
Hongyuan Tao, Xinggang Wang, Lianghui Zhu +7
We present Multimodal Flow, a fully continuous generative model of language and vision. Most unified multimodal models either model both language and quantized images as discrete t…
cs.CV2024
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
Bo Jiang, Shaoyu Chen, Bencheng Liao +6
End-to-end autonomous driving demonstrates strong planning capabilities with large-scale data but still struggles in complex, rare scenarios due to limited commonsense. In contrast…
cs.CV2024★ 3 cited
VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
Bo Jiang, Shaoyu Chen, Hao Gao +4
Learning a human-like driving policy from large-scale driving demonstrations is promising, but the uncertainty and non-deterministic nature of planning make it challenging. Existin…