Skip to the content.

Overview

Fundamentals of RL

K-Armed Bandits & maths

\[Q_t(a) = \frac{\text{sum of rewards when } a \text{ taken prior to } t}{\text{number of times } a \text{ taken prior to } t} = \frac{\sum_{i=1}^{t-1} R_i \cdot \mathbb{1}_{A_i = a}}{\sum_{i=1}^{t-1} \mathbb{1}_{A_i = a}}\] \[Q_{n+1} = \frac{1}{n} \sum_{i=1}^{n} R_i\] \[= \frac{1}{n} \left( R_n + \sum_{i=1}^{n-1} R_i \right)\] \[= \frac{1}{n} \left( R_n + (n-1) \frac{1}{n-1} \sum_{i=1}^{n-1} R_i \right)\] \[= \frac{1}{n} \left( R_n + (n-1) Q_n \right)\] \[= \frac{1}{n} \left( R_n + n Q_n - Q_n \right)\] \[= Q_n + \frac{1}{n} \left( R_n - Q_n \right)\]

Markov Property

State transition matrix

Markov Reward process

Value function and bellman equation