4 papers · 1 filter
Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training
Binwen Tan, Jingchao Wang, Dengzhe Hou +6
Reinforcement learning post-training unlocks complex reasoning in LLMs. Yet benchmark scores reveal only whether a model improved, not what changed inside it, nor how it splits fin…
TimePre: Bridging Accuracy, Efficiency, and Stability in Probabilistic Time-Series Forecasting
Lingyu Jiang, Lingyu Xu, Peiran Li +14
We propose TimePre, a simple framework that unifies the efficiency of Multilayer Perceptron (MLP)-based models with the distributional flexibility of Multiple Choice Learning (MCL)…
KANMixer: a minimal KAN-centered mixer for long-term time series forecasting
Lingyu Jiang, Dengzhe Hou, Yuping Wang +9
Long-term time series forecasting (LTSF) underpins critical applications from energy management to weather prediction, yet achieving reliable multi-step-ahead accuracy remains chal…
Rankitect: Ranking Architecture Search Battling World-class Engineers at Meta Scale
Wei Wen, Kuang-Hung Liu, Igor Fedorov +19
Neural Architecture Search (NAS) has demonstrated its efficacy in computer vision and potential for ranking systems. However, prior work focused on academic problems, which are eva…