1 paper
Apoorv Thapliyal, Vinay Lanka, Swathi Baskaran
ObitoNet employs a Cross Attention mechanism to integrate multimodal inputs, where Vision Transformers (ViT) extract semantic features from images and a point cloud tokenizer proce…