2 papers
cs.LG2026
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
Rui Yuan, Mykola Khandoga, Vinay Kumar Sankarapu
Policy optimization methods like Group Relative Policy Optimization (GRPO) and its variants have achieved strong results on mathematical reasoning and code generation tasks. Despit…
cs.CL2024
Benchmarking Multimodal Models for Ukrainian Language Understanding Across Academic and Cultural Domains
Yurii Paniv, Artur Kiulian, Dmytro Chaplynskyi +4
While the evaluation of multimodal English-centric models is an active area of research with numerous benchmarks, there is a profound lack of benchmarks or evaluation suites for lo…