References
Reinforcing Learning
Preface
1
Markov Chains
2
Multi-armed Bandits
3
Markov Decision Processes
4
Dynamic Programming
5
Policy Gradient Methods
6
Trust Region Policy Optimization
References
7
Introduction
8
Exercises
References
6
Trust Region Policy Optimization
7
Introduction