Repository navigation
Expand file tree
/
Copy pathq_table.py
More file actions
65 lines (57 loc) · 2.45 KB
/
Copy pathq_table.py
File metadata and controls
65 lines (57 loc) · 2.45 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
import numpy as np
from config import Config
class QTable:
"""
Q-таблица, или Q-функция, содержит оценку "хорошести" действий в зависимости от состояний.
Каждая запись в Q-таблицэ задаёт соответствие между парой (состояние, действие) и оценкой:
|State|Action|Value|
| s0 | a0 | 0.5|
| s0 | a1 | 1.3|
| s1 | a0 | -1.0|
...
В нашем случае состояние есть трёх-позиционный тупль (i, j, o), а действие просто целое число.
"""
def __init__(self):
letters = len(Config.letters)
numbers = len(Config.numbers)
orientations = len(Config.orientations)
actions = len(Config.actions)
self._q = np.zeros((letters, numbers, orientations, actions), dtype=np.float16) + Config.q0
def __setitem__(self, key, value):
"""
Данная функция дает возможность устанавливать значения в Q-таблицу как:
q[(состояние, действие)] = value
:param key:
тупль (состояние, действие)
:param value:
вещетвенное число (т.е. float)
"""
assert isinstance(value, float)
s, a = key
i, j, o = s
self._q[i, j, o, a] = value
def __getitem__(self, key):
"""
Данная функция дает возможность считывать значения из Q-таблицы как:
value = q[(состояние, действие)]
:param key:
тупль (состояние, действие)
:return value:
вещетвенное число (т.е. float)
"""
s, a = key
i, j, o = s
return self._q[i, j, o, a]
def get_best_action(self, s):
"""
Для заданного состояния возвращает наилучшее действие и его q-вэлью
:param s:
состояние -- тупль (i, j, o)
:return:
тупль (action, q-value)
"""
assert isinstance(s, tuple)
i, j, o = s
a = self._q[i, j, o].argmax()
q = self._q[i, j, o, a]
return a, q