Showing cs.CLShow all
2 papers · 1 filter
cs.CL2026
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
Qiming Bao, Juho Leinonen, Paul Denny +1
Direct Preference Optimization (DPO), the efficient alternative to PPO-based RLHF, falls short on knowledge-intensive generation: standard preference signals from human annotators…
cs.CL2025
Large Language Models as Common-Sense Heuristics
Andrey Borro, Patricia J Riddle, Michael W Barley +1
While systems designed for solving planning tasks vastly outperform Large Language Models (LLMs) in this domain, they usually discard the rich semantic information embedded within…