Publications (47)
Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence
Granite Vision Team, Leonid Karlinsky, Assaf Arbelle +60
Scaling Granite Code Models to 128K Context
Matt Stallone, Vaibhav Saxena, Leonid Karlinsky +19
Increasing distillable key rate from bound entangled states by using local filtration
Mayank Mishra, Ritabrata Sengupta, Arvind
M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling
Mayank Mishra, Shawn Tan, Ion Stoica +2
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
Wentao Guo, Mayank Mishra, Xinle Cheng +2
Distilling to Hybrid Attention Models via KL-Guided Layer Selection
Yanhong Li, Songlin Yang, Shawn Tan +4
Enhancing Training Efficiency Using Packing with Flash Attention
Achintya Kundu, Rhui Dih Lee, Laura Wynter +2
Prompting with Pseudo-Code Instructions
Mayank Mishra, Prince Kumar, Riyaz Bhat +3
Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
Yikang Shen, Matthew Stallone, Mayank Mishra +6
Direct visualization of local magnetic domain dynamics in a 2D Van der Walls material/ferromagnet interface
Joseph Vimal Vas, Rohit Medwal, Sourabh Manna +6
StarCoder 2 and The Stack v2: The Next Generation
Anton Lozhkov, Raymond Li, Loubna Ben Allal +63
BLOOM: A 176B-Parameter Open-Access Multilingual Language Model
BigScience Workshop, :, Teven Le Scao +391
Variational Inference with Latent Space Quantization for Adversarial Resilience
Vinay Kyatham, Mayank Mishra, Tarun Kumar Yadav +2
PaTH Attention: Position Encoding via Accumulating Householder Transformations
Songlin Yang, Yikang Shen, Kaiyue Wen +5
Adversarial Approximate Inference for Speech to Electroglottograph Conversion
Prathosh A. P., Varun Srivastava, Mayank Mishra
Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping
Muru Zhang, Mayank Mishra, Zhongzhu Zhou +7
A Closer Look at Smoothness in Domain Adversarial Training
Harsh Rangwani, Sumukh K Aithal, Mayank Mishra +2
Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
Masahiro Yasuda, Binh Thien Nguyen, Noboru Harada +10
Lambda Numbers of Finite $p$-Groups
Mayank Mishra, Siddhartha Sarkar
De-Fragmenting the Cloud
Mayank Mishra, Umesh Bellur
Joint Reasoning on Hybrid-knowledge sources for Task-Oriented Dialog
Mayank Mishra, Danish Contractor, Dinesh Raghu
Metric Analysis for Spatial Semantic Segmentation of Sound Scenes
Mayank Mishra, Paul Magron, Romain Serizel
Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data
Harsh Rangwani, Sumukh K Aithal, Mayank Mishra +1
Variational Learning for Unsupervised Knowledge Grounded Dialogs
Mayank Mishra, Dhiraj Madan, Gaurav Pandey +1
Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation
Zhongzhu Zhou, Qingyang Wu, Junxiong Wang +4
Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures
Bowen Li, Mayank Mishra, Y. Isabel Liu +7
On-Disk Data Processing: Issues and Future Directions
Mayank Mishra, Arun K. Somani
Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models
Bowen Pan, Yikang Shen, Haokun Liu +5
StarCoder: may the source be with you!
Raymond Li, Loubna Ben Allal, Yangtian Zi +64
Non-Standard Probabilistic Teleportation through Conventionally Non-Teleporting Channels
Mayank Mishra, Atul Mantri, Priyank Mishra +1
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
Sonam Gupta, Yatin Nandwani, Asaf Yehudai +4
Dense plasma irradiated platinum with improved spin Hall effect
Sachin Kumar, Sourabh Manna, John Rex Mohan +8
Accelerating Gradient-based Meta Learner
Varad Pimpalkhute, Amey Pandit, Mayank Mishra +1
BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback
Gaurav Pandey, Yatin Nandwani, Tahira Naseem +6
Description and Discussion on DCASE 2026 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes
Binh Thien Nguyen, Masahiro Yasuda, Noboru Harada +8
The infrastructure powering IBM's Gen AI model development
Talia Gershon, Seetharami Seelam, Brian Belgodere +143
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
Aniruddha Nrusimha, Mayank Mishra, Naigang Wang +3
Reducing Transformer Key-Value Cache Size with Cross-Layer Attention
William Brandon, Mayank Mishra, Aniruddha Nrusimha +2
Monolithic Integration of Piezo-Optomechanical Photonics and CMOS Electronics
Matthew Zimmermann, Aileen Zhai, Andrew J. Leenheer +10
Demonstration of Entanglement-Enhanced Covert Sensing
Shuhong Hao, Haowei Shi, Christos N. Gagatsos +6
Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code
Taishi Nakamura, Mayank Mishra, Simone Tedeschi +42
Granite Code Models: A Family of Open Foundation Models for Code Intelligence
Mayank Mishra, Matt Stallone, Gaoyuan Zhang +43
Ultra-low loss piezo-optomechanical low-confinement silicon nitride platform for visible wavelength quantum photonic circuits
Mayank Mishra, Gwangho Choi, Wenhua He +7
SantaCoder: don't reach for the stars!
Loubna Ben Allal, Raymond Li, Denis Kocetkov +38
Population inversion in two-level systems possessing permanent dipoles
Mihai Macovei, Mayank Mishra, Christoph H. Keitel
DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
Harsh Rangwani, Pradipto Mondal, Mayank Mishra +2
FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference
Aniruddha Nrusimha, William Brandon, Mayank Mishra +4