6
Trust Region Policy Optimization
Reinforcing Learning
Preface
1
Markov Chains
2
Multi-armed Bandits
3
Markov Decision Processes
4
Dynamic Programming
5
Policy Gradient Methods
6
Trust Region Policy Optimization
References
7
Introduction
8
Exercises
Table of contents
6.1
KL Divergence
6
Trust Region Policy Optimization
6.1
KL Divergence
5
Policy Gradient Methods
References