3 papers
cs.AI2026
HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs
Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni +2
Direct Preference Optimization (DPO) is an effective framework for aligning large language models with human preferences, but it struggles with complex reasoning tasks. DPO optimiz…
cs.CL2026
Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving
Vincent Li, Tim Knappe, Yule Fu +2
Large language models have demonstrated remarkable capabilities in natural language processing tasks requiring multi-step logical reasoning capabilities, such as automated theorem…
cs.CL2024
Pragmatic Metacognitive Prompting Improves LLM Performance on Sarcasm Detection
Joshua Lee, Wyatt Fong, Alexander Le +3
Sarcasm detection is a significant challenge in sentiment analysis due to the nuanced and context-dependent nature of verbiage. We introduce Pragmatic Metacognitive Prompting (PMP)…