14 Commits
Author SHA1 Message Date
jens f70cf1fc1e - added reward sum and reward mean 2024-06-13 08:43:08 +02:00
jens 7a1156125c - bugfix not rewarding properly
- bugfix not set value properly after learn
2024-06-11 21:15:55 +02:00
jens cf7379bf50 add learning after episode 2024-06-11 19:55:51 +02:00
jens 53e4d91ff8 - refactored learning function
- remove state_last, use state instead
- added episode history
2024-06-11 09:00:41 +02:00
jens 73f59f25fc Refactored 2024-06-10 21:08:41 +02:00
jens 3064a8f0b2 No sampling 2024-06-10 21:08:27 +02:00
jens e47959373b Refactored 2024-06-10 21:07:38 +02:00
jens 61d1ab0431 Refactored 2024-06-10 20:48:50 +02:00
jens 285549568d Re-indent with tabs 2024-06-10 20:37:26 +02:00
jens d5b86b057e Added human player 2024-06-10 08:37:21 +02:00
jens c1f64943c3 - simplified debug flags
- added params class
- cleaned up
2024-06-09 18:43:42 +02:00
jens 64960873c8 explorative moves which are identical to best moves estimation will learn 2024-06-09 17:33:10 +02:00
jens 7cad1442df Save values to file 2024-06-09 17:21:35 +02:00
jens 336a9b2cc9 refactored files 2024-06-09 17:03:17 +02:00