AI, Data Science & Cloud Certificates from Google, IBM & Meta
Finance Certifications Goldman Sachs and Amazon Teams Trust
Overview
Google, IBM & Meta Certificates – 40% Off
One Coursera Plus subscription covers most Professional Certificates on Coursera.
Unlock All Certificates
This lecture explains trust-region and proximal policy optimization methods for reinforcement learning. It covers policy gradients, KL divergence, constrained optimization, TRPO and PPO algorithms, and empirical results.
Syllabus
Gradient policy optimization
Recall Policy Gradient
Trust region method
Trust region for policies
Kullback-Leibler Divergence
Reformulation
Derivation (continued)
Trust Region Policy Optimization (TRPO) TRPOO Initialize sa to anything Loop forever (for each episode)
Constrained Optimization
Simpler Objective
Proximal Policy Optimization (PPO)
Empirical Results
Illustration
Taught by
Pascal Poupart