From the 1 of 1 linked paper with an AI index.
1 paper
Yunpeng Chu
The paper proposes MeRLa, a meta‑learning framework that learns task‑specific reward shaping functions to improve reinforcement learning from human feedback for large language mode…