Showing cs.AIShow all
3 papers · 1 filter
cs.AI2026
SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents
Vivek Kulkarni, Sudipta Paul, Aounon Kumar +2
Self-improving agents seek to reduce the human engineering effort behind AI systems by enabling them to evolve and self-improve their performance over time. Recently, methods like…
cs.AI2026
PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent
Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni +4
Existing search-augmented LLM agents are trained using Reinforcement Learning to boost its reasoning capabilities. However, these approaches primarily rely on outcome-level rewards…
cs.AI2024
MedSafetyBench: Evaluating and Improving the Medical Safety of Large Language Models
Tessa Han, Aounon Kumar, Chirag Agarwal +1
As large language models (LLMs) develop increasingly sophisticated capabilities and find applications in medical settings, it becomes important to assess their medical safety due t…