3 papers
cs.LG2025
Segmenting Action-Value Functions Over Time-Scales in SARSA via TD()
Mahammad Humayoo
In numerous episodic reinforcement learning (RL) environments, SARSA-based methodologies are employed to enhance policies aimed at maximizing returns over long horizons. Traditiona…
cs.LG2025
Relative Importance Sampling for off-Policy Actor-Critic in Deep Reinforcement Learning
Mahammad Humayoo, Gengzhong Zheng, Xiaoqing Dong +7
Off-policy learning exhibits greater instability when compared to on-policy learning in reinforcement learning (RL). The difference in probability distribution between the target p…
cs.LG2024
Time-Scale Separation in Q-Learning: Extending TD() for Action-Value Function Decomposition
Mahammad Humayoo
Q-Learning is a fundamental off-policy reinforcement learning (RL) algorithm that has the objective of approximating action-value functions in order to learn optimal policies. None…