3 papers
cs.AI2026
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani +1
Automatic speech recognition is dominated by autoregressive decoders that emit one token at a time. We ask whether a discrete diffusion language model can transcribe speech instead…
cs.CL2026
The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani +1
Large Language Models are increasingly being deployed to extract structured data from unstructured and semi-structured sources: parsing invoices, medical records, and converting PD…
cs.CV2024
Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking
Harsha Vardhan Khurdula, Basem Rizk, Indus Khaitan +3
Current benchmarks for evaluating Vision Language Models (VLMs) often fall short in thoroughly assessing model abilities to understand and process complex visual and textual conten…