2 papers
cs.IR2026
PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation
Kirill Dubovikov, Omar El Mansouri, Hachem Madmoun +12
Petroleum-engineering search exposes a supervision gap for strong general retrievers: relevant evidence exists in public web text, but domain relevance labels are scarce. To addres…
cs.LG2026
Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
Omar El Mansouri, Fathinah Asma Izzati, Mohamed El Amine Seddik +1
Reinforcement learning from human feedback (RLHF) or verifiable rewards (RLVR), the standard paradigm for aligning LLMs or building recent SOTA reasoning models, is highly sensitiv…