Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Baseline-Free Policy Optimization for Neural Combinatorial Optimization
Carlos S. Sepúlveda, Gonzalo A. Ruz
Neural combinatorial optimization (NCO) trains autoregressive policies to solve routing problems. The standard training algorithm, REINFORCE with a rollout baseline, requires maint…
cs.LG2026
Critic-Free Deep Reinforcement Learning for Maritime Coverage Path Planning on Irregular Hexagonal Grids
Carlos S. Sepúlveda, Gonzalo A. Ruz
Maritime surveillance missions, such as search and rescue and environmental monitoring, rely on the efficient allocation of sensing assets over vast and geometrically complex areas…