3 papers
cs.AI2026
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani +1
Automatic speech recognition is dominated by autoregressive decoders that emit one token at a time. We ask whether a discrete diffusion language model can transcribe speech instead…
cs.CL2026
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani +1
Large Language Models are increasingly being deployed to extract structured data from unstructured and semi-structured sources: parsing invoices, medical records, and converting PD…
cs.AI2026
Interfaze: The Future of AI is built on Task-Specific Small Models
Harsha Vardhan Khurdula, Vineet Agarwal, Yoeven D Khemlani
We present Interfaze, a native hybrid model that fuses task-specific deep neural networks (CNNs and DNNs) directly into a transformer decoder through a shared embedding space. Spec…