activity
20242026
most citedDual-Agent Deep Reinforcement Learning for Dynamic Pricing and Replenishment

1 citations · 1 across the 4 of their papers we have counts for

collaborators

5 papers

cs.LG2026

RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood

Yifu Zheng

Correctness-based Reinforcement Learning with Verifiable Rewards (RLVR) trains language models from binary feedback on sampled outputs, but the objective optimized in expectation a…

cs.AI2026

Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models

Qi Liu, Mingdi Sun, Yongyi He +5

Supervised fine-tuning (SFT) followed by reinforcement learning (RL) has become a standard post-training paradigm for large language models. This paradigm provides a cold-start for…

cs.CV2025

Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer

Tao Ren, Zishi Zhang, Jingyang Jiang +9

The probabilistic diffusion model (DM), generating content by inferencing through a recursive chain structure, has emerged as a powerful framework for visual generation. After pre-…

cs.LG20241 cited

Dual-Agent Deep Reinforcement Learning for Dynamic Pricing and Replenishment

Yi Zheng, Zehao Li, Peng Jiang +1

We study the dynamic pricing and replenishment problems under inconsistent decision frequencies. Different from the traditional demand assumption, the discreteness of demand and th…

cs.AI2024

Deep Reinforcement Learning for Solving Management Problems: Towards A Large Management Mode

Jinyang Jiang, Xiaotian Liu, Tao Ren +5

We introduce a deep reinforcement learning (DRL) approach for solving management problems including inventory management, dynamic pricing, and recommendation. This DRL approach has…