2 papers
cs.AI2026
Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows
Shivam Rawat, Lucie Flek
Agentic AI systems are increasingly being integrated into scientific workflows, yet their behavior under realistic conditions remains insufficiently understood. We evaluate CMBAgen…
cs.CL2026
Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?
Shivam Rawat, Lucie Flek, Florian Mai +1
Reasoning in large language models is often discussed as a single capability, but some of its gains may stem from simpler underlying operations. We examine two such primitives, rec…