NewEvery arXiv paper, its researchers & institutions — mapped.
papers

Publications (47)

cs.CV2025

Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence

Granite Vision Team, Leonid Karlinsky, Assaf Arbelle +60

cs.AI2024

Scaling Granite Code Models to 128K Context

Matt Stallone, Vaibhav Saxena, Leonid Karlinsky +19

quant-ph2020

Increasing distillable key rate from bound entangled states by using local filtration

Mayank Mishra, Ritabrata Sengupta, Arvind

cs.LG2026

M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling

Mayank Mishra, Shawn Tan, Ion Stoica +2

cs.LG2026

SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations

Wentao Guo, Mayank Mishra, Xinle Cheng +2

cs.CL2025

Distilling to Hybrid Attention Models via KL-Guided Layer Selection

Yanhong Li, Songlin Yang, Shawn Tan +4

cs.LG2024

Enhancing Training Efficiency Using Packing with Flash Attention

Achintya Kundu, Rhui Dih Lee, Laura Wynter +2

cs.CL2023

Prompting with Pseudo-Code Instructions

Mayank Mishra, Prince Kumar, Riyaz Bhat +3

cs.CL2024

Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler

Yikang Shen, Matthew Stallone, Mayank Mishra +6

cond-mat.mtrl-sci2024

Direct visualization of local magnetic domain dynamics in a 2D Van der Walls material/ferromagnet interface

Joseph Vimal Vas, Rohit Medwal, Sourabh Manna +6

cs.SE2024

StarCoder 2 and The Stack v2: The Next Generation

Anton Lozhkov, Raymond Li, Loubna Ben Allal +63

cs.CL2023

BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

BigScience Workshop, :, Teven Le Scao +391

cs.CV2019

Variational Inference with Latent Space Quantization for Adversarial Resilience

Vinay Kyatham, Mayank Mishra, Tarun Kumar Yadav +2

cs.CL2026

PaTH Attention: Position Encoding via Accumulating Householder Transformations

Songlin Yang, Yikang Shen, Kaiyue Wen +5

eess.AS2019

Adversarial Approximate Inference for Speech to Electroglottograph Conversion

Prathosh A. P., Varun Srivastava, Mayank Mishra

cs.LG2025

Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping

Muru Zhang, Mayank Mishra, Zhongzhu Zhou +7

cs.LG2022

A Closer Look at Smoothness in Domain Adversarial Training

Harsh Rangwani, Sumukh K Aithal, Mayank Mishra +2

cs.SD2025

Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes

Masahiro Yasuda, Binh Thien Nguyen, Noboru Harada +10

math.GR2021

Lambda Numbers of Finite $p$-Groups

Mayank Mishra, Siddhartha Sarkar

cs.DC2015

De-Fragmenting the Cloud

Mayank Mishra, Umesh Bellur

cs.CL2023

Joint Reasoning on Hybrid-knowledge sources for Task-Oriented Dialog

Mayank Mishra, Danish Contractor, Dinesh Raghu

cs.SD2026

Metric Analysis for Spatial Semantic Segmentation of Sound Scenes

Mayank Mishra, Paul Magron, Romain Serizel

cs.LG2022

Escaping Saddle Points for Effective Generalization on Class-Imbalanced Data

Harsh Rangwani, Sumukh K Aithal, Mayank Mishra +1

cs.CL2022

Variational Learning for Unsupervised Knowledge Grounded Dialogs

Mayank Mishra, Dhiraj Madan, Gaurav Pandey +1

cs.LG2026

Taylor-Calibrate: Principled Initialization for Hybrid Linear Attention Distillation

Zhongzhu Zhou, Qingyang Wu, Junxiong Wang +4

cs.RO2026

Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures

Bowen Li, Mayank Mishra, Y. Isabel Liu +7

cs.DC2017

On-Disk Data Processing: Issues and Future Directions

Mayank Mishra, Arun K. Somani

cs.LG2024

Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models

Bowen Pan, Yikang Shen, Haokun Liu +5

cs.CL2023

StarCoder: may the source be with you!

Raymond Li, Loubna Ben Allal, Yangtian Zi +64

quant-ph2011

Non-Standard Probabilistic Teleportation through Conventionally Non-Teleporting Channels

Mayank Mishra, Atul Mantri, Priyank Mishra +1

cs.CL2024

Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models

Sonam Gupta, Yatin Nandwani, Asaf Yehudai +4

cond-mat.mtrl-sci2023

Dense plasma irradiated platinum with improved spin Hall effect

Sachin Kumar, Sourabh Manna, John Rex Mohan +8

cs.LG2021

Accelerating Gradient-based Meta Learner

Varad Pimpalkhute, Amey Pandit, Mayank Mishra +1

cs.LG2024

BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback

Gaurav Pandey, Yatin Nandwani, Tahira Naseem +6

eess.AS2026

Description and Discussion on DCASE 2026 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes

Binh Thien Nguyen, Masahiro Yasuda, Noboru Harada +8

cs.DC2025

The infrastructure powering IBM's Gen AI model development

Talia Gershon, Seetharami Seelam, Brian Belgodere +143

cs.LG2024

Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization

Aniruddha Nrusimha, Mayank Mishra, Naigang Wang +3

cs.LG2024

Reducing Transformer Key-Value Cache Size with Cross-Layer Attention

William Brandon, Mayank Mishra, Aniruddha Nrusimha +2

physics.optics2026

Monolithic Integration of Piezo-Optomechanical Photonics and CMOS Electronics

Matthew Zimmermann, Aileen Zhai, Andrew J. Leenheer +10

quant-ph2022

Demonstration of Entanglement-Enhanced Covert Sensing

Shuhong Hao, Haowei Shi, Christos N. Gagatsos +6

cs.CL2024

Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code

Taishi Nakamura, Mayank Mishra, Simone Tedeschi +42

cs.AI2024

Granite Code Models: A Family of Open Foundation Models for Code Intelligence

Mayank Mishra, Matt Stallone, Gaoyuan Zhang +43

physics.optics2026

Ultra-low loss piezo-optomechanical low-confinement silicon nitride platform for visible wavelength quantum photonic circuits

Mayank Mishra, Gwangho Choi, Wenhua He +7

cs.SE2023

SantaCoder: don't reach for the stars!

Loubna Ben Allal, Raymond Li, Denis Kocetkov +38

quant-ph2015

Population inversion in two-level systems possessing permanent dipoles

Mihai Macovei, Mayank Mishra, Christoph H. Keitel

cs.CV2024

DeiT-LT Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets

Harsh Rangwani, Pradipto Mondal, Mayank Mishra +2

cs.LG2025

FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference

Aniruddha Nrusimha, William Brandon, Mayank Mishra +4