Commit Graph

  • 455ea692f5 Make --train, --human, --load plain flags (no value required) master jensandClaude Sonnet 5 2026-07-15 21:16:39 +02:00
  • 2f56608c54 Make --num control the number of play games, not just training jensandClaude Sonnet 5 2026-07-15 21:14:26 +02:00
  • 2fbbd0c712 Add README documenting project structure and CLI usage jensandClaude Sonnet 5 2026-07-15 21:10:33 +02:00
  • aec0ec623e added verbos argument jens 2025-03-12 08:27:09 +01:00
  • 1941061ed4 take program flags from command line jens 2025-03-12 08:22:11 +01:00
  • f70cf1fc1e - added reward sum and reward mean jens 2024-06-13 08:43:08 +02:00
  • c50553c94a fixed endgame jens 2024-06-11 22:05:06 +02:00
  • 7edfa627d0 Changed training to update values-file during training jens 2024-06-11 21:49:49 +02:00
  • 7a1156125c - bugfix not rewarding properly - bugfix not set value properly after learn jens 2024-06-11 21:15:55 +02:00
  • e8d07f9d84 - fixed human player jens 2024-06-11 20:18:37 +02:00
  • cf7379bf50 add learning after episode jens 2024-06-11 19:55:51 +02:00
  • 53e4d91ff8 - refactored learning function - remove state_last, use state instead - added episode history jens 2024-06-11 09:00:41 +02:00
  • 73f59f25fc Refactored jens 2024-06-10 21:08:41 +02:00
  • 3064a8f0b2 No sampling jens 2024-06-10 21:08:27 +02:00
  • e47959373b Refactored jens 2024-06-10 21:07:38 +02:00
  • 61d1ab0431 Refactored jens 2024-06-10 20:48:50 +02:00
  • 285549568d Re-indent with tabs jens 2024-06-10 20:37:26 +02:00
  • d5b86b057e Added human player jens 2024-06-10 08:37:21 +02:00
  • 59d1d28357 added report counter jens 2024-06-09 19:00:21 +02:00
  • c1f64943c3 - simplified debug flags - added params class - cleaned up jens 2024-06-09 18:43:42 +02:00
  • 64960873c8 explorative moves which are identical to best moves estimation will learn jens 2024-06-09 17:33:10 +02:00
  • 19c972bc7d test sample() only when main jens 2024-06-09 17:30:24 +02:00
  • 7cad1442df Save values to file jens 2024-06-09 17:21:35 +02:00
  • 336a9b2cc9 refactored files jens 2024-06-09 17:03:17 +02:00
  • aaff8e44e0 Fixed awarding and penalty at the end of each game jens 2024-06-09 16:42:32 +02:00
  • 1cd1fb729e - refacored state jens 2024-06-09 15:03:35 +02:00
  • ad32b75e50 Added silent training jens 2024-06-09 00:37:04 +02:00
  • a812aebb77 Added probability paramter for exploration jens 2024-06-09 00:29:43 +02:00
  • 53608e96f0 Fixed sample jens 2024-06-08 23:34:09 +02:00
  • cdc71b3eab Fixed sample jens 2024-06-08 23:31:37 +02:00
  • b9f83c26a1 add training without debug jens 2024-06-08 21:09:06 +02:00
  • 8cdb816409 Refactored jens 2024-06-08 21:00:00 +02:00
  • f97c3b6f56 - refactored jens 2024-06-08 20:47:30 +02:00
  • 5b7430f208 - control debug output - fixed last state - refactored jens 2024-06-08 20:24:38 +02:00
  • 3a0246d0c9 - added idea project - improved formatting - improved state print jens 2024-06-08 18:55:19 +02:00
  • da12213f95 Initial commit jens 2024-06-08 17:54:04 +02:00