2 papers
cs.HC2026
Building AI Companions that Prioritise Learning over Performance
Hassan Khosravi, Dragan Gasevic, Shazia Sadiq +7
Large language models (LLMs) are rapidly transforming knowledge work by improving the quality and efficiency of tasks such as writing, coding, and data analysis. However, their gro…
cs.CL2026
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
Qiming Bao, Juho Leinonen, Paul Denny +1
Direct Preference Optimization (DPO), the efficient alternative to PPO-based RLHF, falls short on knowledge-intensive generation: standard preference signals from human annotators…