jens
|
7a1156125c
|
- bugfix not rewarding properly
- bugfix not set value properly after learn
|
2024-06-11 21:15:55 +02:00 |
|
jens
|
cf7379bf50
|
add learning after episode
|
2024-06-11 19:55:51 +02:00 |
|
jens
|
53e4d91ff8
|
- refactored learning function
- remove state_last, use state instead
- added episode history
|
2024-06-11 09:00:41 +02:00 |
|
jens
|
73f59f25fc
|
Refactored
|
2024-06-10 21:08:41 +02:00 |
|
jens
|
3064a8f0b2
|
No sampling
|
2024-06-10 21:08:27 +02:00 |
|
jens
|
e47959373b
|
Refactored
|
2024-06-10 21:07:38 +02:00 |
|
jens
|
61d1ab0431
|
Refactored
|
2024-06-10 20:48:50 +02:00 |
|
jens
|
285549568d
|
Re-indent with tabs
|
2024-06-10 20:37:26 +02:00 |
|
jens
|
d5b86b057e
|
Added human player
|
2024-06-10 08:37:21 +02:00 |
|
jens
|
c1f64943c3
|
- simplified debug flags
- added params class
- cleaned up
|
2024-06-09 18:43:42 +02:00 |
|
jens
|
64960873c8
|
explorative moves which are identical to best moves estimation will learn
|
2024-06-09 17:33:10 +02:00 |
|
jens
|
7cad1442df
|
Save values to file
|
2024-06-09 17:21:35 +02:00 |
|
jens
|
336a9b2cc9
|
refactored files
|
2024-06-09 17:03:17 +02:00 |
|