Publications (32)
On Compressing U-net Using Knowledge Distillation
Karttikeya Mangalam, Mathieu Salzamann
MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video Recognition
Chao-Yuan Wu, Yanghao Li, Karttikeya Mangalam +4
Long-term Human Motion Prediction with Scene Context
Zhe Cao, Hang Gao, Karttikeya Mangalam +3
Bringing Image Scene Structure to Video via Frame-Clip Consistency of Object Tokens
Elad Ben-Avraham, Roei Herzig, Karttikeya Mangalam +5
EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding
Karttikeya Mangalam, Raiymbek Akshulakov, Jitendra Malik
Re^2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal Action Localization
Chen Zhao, Shuming Liu, Karttikeya Mangalam +1
It Is Not the Journey but the Destination: Endpoint Conditioned Trajectory Prediction
Karttikeya Mangalam, Harshayu Girase, Shreyas Agarwal +4
Overcoming Mode Collapse with Adaptive Multi Adversarial Training
Karttikeya Mangalam, Rohin Garg
Ego4D: Around the World in 3,000 Hours of Egocentric Video
Kristen Grauman, Andrew Westbury, Eugene Byrne +82
xT: Nested Tokenization for Larger Context in Large Images
Ritwik Gupta, Shufan Li, Tyler Zhu +3
Speculative Decoding with Big Little Decoder
Sehoon Kim, Karttikeya Mangalam, Suhong Moon +4
From Goals, Waypoints & Paths To Long Term Human Trajectory Forecasting
Karttikeya Mangalam, Yang An, Harshayu Girase +1
PaReprop: Fast Parallelized Reversible Backpropagation
Tyler Zhu, Karttikeya Mangalam
Adaptive Human Trajectory Prediction via Latent Corridors
Neerja Thakkar, Karttikeya Mangalam, Andrea Bajcsy +1
MViTv2: Improved Multiscale Vision Transformers for Classification and Detection
Yanghao Li, Chao-Yuan Wu, Haoqi Fan +4
Reversible Vision Transformers
Karttikeya Mangalam, Haoqi Fan, Yanghao Li +4
Multiscale Vision Transformers
Haoqi Fan, Bo Xiong, Karttikeya Mangalam +4
Object-Region Video Transformers
Roei Herzig, Elad Ben-Avraham, Karttikeya Mangalam +5
Bitwise Operations of Cellular Automaton on Gray-scale Images
Karttikeya Mangalam, K S Venkatesh
Squeezeformer: An Efficient Transformer for Automatic Speech Recognition
Sehoon Kim, Amir Gholami, Albert Shaw +5
Structured Video Tokens @ Ego4D PNR Temporal Localization Challenge 2022
Elad Ben-Avraham, Roei Herzig, Karttikeya Mangalam +5
Future Person Localization in First-Person Videos
Takuma Yagi, Karttikeya Mangalam, Ryo Yonetani +1
Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization
Zhanda Zhu, Christina Giannoula, Muralidhar Andoorveedu +4
LOKI: Long Term and Key Intentions for Trajectory Prediction
Harshayu Girase, Haiming Gang, Srikanth Malla +4
LLM2LLM: Boosting LLMs with Novel Iterative Data Enhancement
Nicholas Lee, Thanakul Wattanawong, Sehoon Kim +6
Diffusion Models as Masked Autoencoders
Chen Wei, Karttikeya Mangalam, Po-Yao Huang +7
Re-evaluating the Need for Multimodal Signals in Unsupervised Grammar Induction
Boyi Li, Rodolfo Corona, Karttikeya Mangalam +7
Do Vision and Language Encoders Represent the World Similarly?
Mayug Maniparambil, Raiymbek Akshulakov, Yasser Abdelaziz Dahou Djilali +4
Dr$^2$Net: Dynamic Reversible Dual-Residual Networks for Memory-Efficient Finetuning
Chen Zhao, Shuming Liu, Karttikeya Mangalam +5
Learning Spontaneity to Improve Emotion Recognition In Speech
Karttikeya Mangalam, Tanaya Guha
Sequential Modeling Enables Scalable Learning for Large Vision Models
Yutong Bai, Xinyang Geng, Karttikeya Mangalam +5
Disentangling Human Dynamics for Pedestrian Locomotion Forecasting with Noisy Supervision
Karttikeya Mangalam, Ehsan Adeli, Kuan-Hui Lee +2