Showing cs.LGShow all
2 papers · 1 filter
cs.LG2026
Inference-Time Code Selection via Symbolic Equivalence Partitioning
David Cho, Yifan Wang, Fanping Sui +1
Sampling multiple candidate programs at inference time is an effective way to improve LLM code generation. However, its benefit depends on reliably selecting a correct solution fro…
cs.LG2026
Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control
Bolian Li, Yifan Wang, Yi Ding +3
Reinforcement learning (RL) has enabled complex reasoning abilities in large language models (LLMs). However, most RL algorithms suffer from performance saturation, preventing cont…