2 papers
cs.SE2026
Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems
Eric Liang
Large language model (LLM) applications are increasingly expected to satisfy deterministic institutional requirements while relying on probabilistic generative components. This mis…
cs.IR2026
SPECTRA: Synthetic IR Test Collections with Relevance Oracles and Controlled Distractor Diagnostics
Eric Liang
Scalable information retrieval testing needs corpora that are large enough to stress index construction, ranking latency, query routing, and evaluation tooling, yet human-judged te…