step-by-step
discount factor
γ
state
π
(
a
|
s
)
action
P
(
s
′|
s
,
a
)
environment transition
optimal action
0.8
P
(
s
′|
s
,
a
)
probability
+2
reward
r
(
s
,
a
,
s
′)
×
value computation
value iteration
◀
▶
⟲
⏭