3 papers
cs.LG2026
Learning from Language Feedback via Variational Policy Distillation
Yang Li, Erik Nijkamp, Semih Yavuz +1
Reinforcement learning from verifiable rewards (RLVR) suffers from sparse outcome signals, creating severe exploration bottlenecks on complex reasoning tasks. Recent on-policy self…
cs.CL2025
Convomem Benchmark: Why Your First 150 Conversations Don't Need RAG
Egor Pakhomov, Erik Nijkamp, Caiming Xiong
We introduce a comprehensive benchmark for conversational memory evaluation containing 75,336 question-answer pairs across diverse categories including user facts, assistant recall…
cs.CL2025
xGen-small Technical Report
Erik Nijkamp, Bo Pang, Egor Pakhomov +5
We introduce xGen-small, a family of 4B and 9B Transformer decoder models optimized for long-context applications. Our vertically integrated pipeline unites domain-balanced, freque…