BSDA5007 · Knowledge Base
Reinforcement Learning Notes
10
Concepts
0
Facts
0
Procedures
concept
1m
198 - Multi-Armed Bandits- Exploration vs Exploitation
concept
1m
199 - Markov Decision Processes & Bellman Equations
concept
1m
200 - Dynamic Programming- Policy Evaluation, Value Iteration, and Policy Iteration
concept
1m
201 - Monte Carlo Methods- First-Visit, Every-Visit, and Monte Carlo Control
concept
1m
202 - Temporal Difference Learning- TD(0), TD(λ), and Eligibility Traces
concept
1m
203 - Q-Learning and SARSA- Off-Policy and On-Policy TD Control
concept
1m
204 - Deep Q-Networks- Experience Replay, Target Networks, Rainbow
concept
1m
205 - Policy Gradients- REINFORCE and Actor-Critic
concept
1m
206 - Actor-Critic Methods- A2C, A3C, and Advantage Estimation
concept
1m