From the 1 of 2 linked papers with an AI index.
2 papers
cs.AI2026
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani +1
The paper introduces an audio‑native interface for a frozen discrete‑diffusion language model (DiffusionGemma) that transcribes speech in parallel using a Whisper encoder, a projec…
cs.CL2026
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani +1
Large Language Models are increasingly being deployed to extract structured data from unstructured and semi-structured sources: parsing invoices, medical records, and converting PD…