3 papers
cs.CV2026
m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning
Yosub Shin, Michael Buriek, Igor Molybog
Vision--language models (VLMs) achieve strong performance on many multimodal benchmarks but remain brittle on spatial reasoning tasks that require aligning abstract overhead repres…
cs.AI2026
Data-Efficient Curation for Multimodal Reasoning under Fixed Training Protocols
Yosub Shin, Michael Buriek, Boris Sobolev +5
We study data curation for multimodal reasoning in a fixed-protocol fine-tuning regime, where the base model, optimizer, training schedule, and evaluation pipeline are held constan…
cs.CV2025
Beyond Audio and Pose: A General-Purpose Framework for Video Synchronization
Yosub Shin, Igor Molybog
Video synchronization-aligning multiple video streams capturing the same event from different angles-is crucial for applications such as reality TV show production, sports analysis…