From the 1 of 3 linked papers with an AI index.
3 papers
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani +1
The paper introduces an audio‑native interface for a frozen discrete‑diffusion language model (DiffusionGemma) that transcribes speech in parallel using a Whisper encoder, a projec…
Interfaze: The Future of AI is built on Task-Specific Small Models
Harsha Vardhan Khurdula, Vineet Agarwal, Yoeven D Khemlani
We present Interfaze, a native hybrid model that fuses task-specific deep neural networks (CNNs and DNNs) directly into a transformer decoder through a shared embedding space. Spec…
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani +1
Large Language Models are increasingly being deployed to extract structured data from unstructured and semi-structured sources: parsing invoices, medical records, and converting PD…