-
455ea692f5
Make --train, --human, --load plain flags (no value required)
master

jensandClaude Sonnet 5
2026-07-15 21:16:39 +02:00
-
2f56608c54
Make --num control the number of play games, not just training

jensandClaude Sonnet 5
2026-07-15 21:14:26 +02:00
-
2fbbd0c712
Add README documenting project structure and CLI usage

jensandClaude Sonnet 5
2026-07-15 21:10:33 +02:00
-
aec0ec623e
added verbos argument
jens
2025-03-12 08:27:09 +01:00
-
1941061ed4
take program flags from command line
jens
2025-03-12 08:22:11 +01:00
-
f70cf1fc1e
- added reward sum and reward mean
jens
2024-06-13 08:43:08 +02:00
-
c50553c94a
fixed endgame
jens
2024-06-11 22:05:06 +02:00
-
7edfa627d0
Changed training to update values-file during training
jens
2024-06-11 21:49:49 +02:00
-
7a1156125c
- bugfix not rewarding properly - bugfix not set value properly after learn
jens
2024-06-11 21:15:55 +02:00
-
e8d07f9d84
- fixed human player
jens
2024-06-11 20:18:37 +02:00
-
cf7379bf50
add learning after episode
jens
2024-06-11 19:55:51 +02:00
-
53e4d91ff8
- refactored learning function - remove state_last, use state instead - added episode history
jens
2024-06-11 09:00:41 +02:00
-
73f59f25fc
Refactored
jens
2024-06-10 21:08:41 +02:00
-
3064a8f0b2
No sampling
jens
2024-06-10 21:08:27 +02:00
-
e47959373b
Refactored
jens
2024-06-10 21:07:38 +02:00
-
61d1ab0431
Refactored
jens
2024-06-10 20:48:50 +02:00
-
285549568d
Re-indent with tabs
jens
2024-06-10 20:37:26 +02:00
-
d5b86b057e
Added human player
jens
2024-06-10 08:37:21 +02:00
-
59d1d28357
added report counter
jens
2024-06-09 19:00:21 +02:00
-
c1f64943c3
- simplified debug flags - added params class - cleaned up
jens
2024-06-09 18:43:42 +02:00
-
64960873c8
explorative moves which are identical to best moves estimation will learn
jens
2024-06-09 17:33:10 +02:00
-
19c972bc7d
test sample() only when main
jens
2024-06-09 17:30:24 +02:00
-
7cad1442df
Save values to file
jens
2024-06-09 17:21:35 +02:00
-
336a9b2cc9
refactored files
jens
2024-06-09 17:03:17 +02:00
-
aaff8e44e0
Fixed awarding and penalty at the end of each game
jens
2024-06-09 16:42:32 +02:00
-
1cd1fb729e
- refacored state
jens
2024-06-09 15:03:35 +02:00
-
ad32b75e50
Added silent training
jens
2024-06-09 00:37:04 +02:00
-
a812aebb77
Added probability paramter for exploration
jens
2024-06-09 00:29:43 +02:00
-
53608e96f0
Fixed sample
jens
2024-06-08 23:34:09 +02:00
-
cdc71b3eab
Fixed sample
jens
2024-06-08 23:31:37 +02:00
-
b9f83c26a1
add training without debug
jens
2024-06-08 21:09:06 +02:00
-
8cdb816409
Refactored
jens
2024-06-08 21:00:00 +02:00
-
f97c3b6f56
- refactored
jens
2024-06-08 20:47:30 +02:00
-
5b7430f208
- control debug output - fixed last state - refactored
jens
2024-06-08 20:24:38 +02:00
-
3a0246d0c9
- added idea project - improved formatting - improved state print
jens
2024-06-08 18:55:19 +02:00
-
da12213f95
Initial commit
jens
2024-06-08 17:54:04 +02:00