8 papers
Monte Carlo Query Search: Active Capability Assessment of AI Agents
Daniel Bramblett, Rushang Karia, Adrian Ciotinga +3
Black-box AI (BBAI) systems, including foundation-model agents, are increasingly used for sequential decision making. Safe deployment requires methods for characterizing what such…
Context-Sensitive Abstractions for Reinforcement Learning with Parameterized Actions
Rashmeet Kaur Nayyar, Naman Shah, Siddharth Srivastava
Real-world sequential decision-making often involves parameterized action spaces that require both, decisions regarding discrete actions and decisions about continuous action param…
From Real World to Logic and Back: Learning Generalizable Relational Concepts For Long Horizon Robot Planning
Naman Shah, Jayesh Nagpal, Siddharth Srivastava
Robots still lag behind humans in their ability to generalize from limited experience, particularly when transferring learned behaviors to long-horizon tasks in unseen environments…
Using Explainable AI and Hierarchical Planning for Outreach with Robots
Rushang Karia, Jayesh Nagpal, Daksh Dobhal +4
Understanding how robots plan and execute tasks is crucial in today's world, where they are becoming more prevalent in our daily lives. However, teaching non-experts, such as K-12…
Belief-State Query Policies for User-Aligned POMDPs
Daniel Bramblett, Siddharth Srivastava
Planning in real-world settings often entails addressing partial observability while aligning with users' requirements. We present a novel framework for expressing users' constrain…
Autonomous Evaluation of LLMs for Truth Maintenance and Reasoning Tasks
Rushang Karia, Daniel Bramblett, Daksh Dobhal +1
This paper presents AutoEval, a novel benchmark for scaling Large Language Model (LLM) assessment in formal tasks with clear notions of correctness, such as truth maintenance in tr…