4 papers
Position: Evaluation Scores Are Perishable Knowledge Claims
Sankalp Gilda, Shlok Gilda
Evaluation methodologies for language models increasingly combine multiple signals, from automated metrics and LLM-as-judge ratings to human assessments and benchmark suite results…
Structured Abductive-Deductive-Inductive Reasoning for LLMs via Algebraic Invariants
Sankalp Gilda, Shlok Gilda
Large language models exhibit systematic limitations in structured logical reasoning: they conflate hypothesis generation with verification, cannot distinguish conjecture from vali…
AI-Assisted Engineering Should Track the Epistemic Status and Temporal Validity of Architectural Decisions
Sankalp Gilda, Shlok Gilda
This position paper argues that AI-assisted software engineering requires explicit mechanisms for tracking the epistemic status and temporal validity of architectural decisions. LL…
Are Fact-Checking Tools Helpful? An Exploration of the Usability of Google Fact Check
Qiangeng Yang, Tess Christensen, Shlok Gilda +4
Fact-checking-specific search tools such as Google Fact Check are a promising way to combat misinformation on social media, especially during events bringing significant social inf…