2 papers
cs.CV2026
On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models
Yao Zheng, Tian Zhang
3D point cloud-language models (3D-LLMs) enable 3D understanding by pairing point cloud encoders with large language models, but existing methods rely on costly multi-modal encoder…
cs.CV2026
MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model
Lichen Bai, Tianhao Zhang, Shitong Shao +14
As an increasing majority of global video content is consumed on social platforms for interactive social purposes, video generation models built for social worlds are important but…