10 papers · 1 filter
Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization
Mikhail Persiianov, Arip Asadulaev, Nikita Andreev +5
Learning conditional distributions is a central problem in machine learning, which is typically approached via supervised methods with paired data …
Dual Advantage Fields
Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin +5
Offline goal-conditioned reinforcement learning requires both long-horizon reachability estimates and local action comparisons. Dual goal representations provide value fields that…
Zero-Shot Off-Policy Learning
Arip Asadulaev, Maksim Bobrin, Salem Lahlou +3
Off-policy learning methods seek to derive an optimal policy directly from a fixed dataset of prior interactions. This objective presents significant challenges, primarily due to t…
Sparse Scheduled Diffusion Guidance for Inverse Problems
Abduragim Shtanchaev, Albina Ilina, Yazid Janati +3
Pretrained diffusion models are effective priors for Bayesian inverse problems, but posterior sampling with these priors is often costly because data-consistency guidance is applie…
Convex Compositional Reasoning Models
Meir Roketlishvili, Semyon Semenov, Maksim Bobrin +7
Compositional energy-based models can generalize to larger combinatorial reasoning problems by reusing a learned factor energy across many local constraints. In our paper, we show…
Value-Gradient Hypothesis of RL for LLMs
Arip Asadulaev, Daniil Ognev, Karim Salta +1
Reinforcement learning substantially improves pretrained language models, but it remains understudied why critic-free methods such as PPO and GRPO work as well as they do, and when…