2 papers
cs.CV2026
Fysiverse-3D-Vision Technical Report: Generating Executable 3D Worlds from Images through Unified Spatial Reasoning
Dingkang Yang, Yizhou Liu, Wendong Cheng +5
Generative models have advanced image-conditioned 3D content creation, yet generating controllable and executable 3D scenes from a single image remains challenging. Existing 3D gen…
cs.AI2026
OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities
Yizhou Liu, Jinghang Han, Kaixiang Qiu +8
Omni-modal models have expanded multimodal interaction across vision, audio, speech, and language. However, their training is predominantly organized around semantic descriptions a…