state π(a|s) action P(s′|s,a) environment transition optimal action 0.8 P(s′|s,a) probability +2 reward r(s,a,s′)