Showing cs.CLShow all
2 papers · 1 filter
cs.CL2024
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
Tianduo Wang, Shichen Li, Wei Lu
Effective training of language models (LMs) for mathematical reasoning tasks demands high-quality supervised fine-tuning data. Besides obtaining annotations from human experts, a c…
cs.CL2023
Learning Multi-Step Reasoning by Solving Arithmetic Tasks
Tianduo Wang, Wei Lu
Mathematical reasoning is regarded as a necessary ability for Language Models (LMs). Recent works demonstrate large LMs' impressive performance in solving math problems. The succes…