41554 blogs · [ { "id": "01a0876a-94c5-72ca-8425-0bbfa309eb94", "title": "Should we abandon RL? Is it the right approach?", "url": "https://www.decisionsanddragons.com/posts/should_we_abandon_rl/", "published_at": "2025-07-03T03:43:37+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa39016ee", "title": "Why is it better to subtract a baseline in REINFORCE?", "url": "https://www.decisionsanddragons.com/posts/why_is_it_better_to_subtract_a_baseline-in-reinforce/", "published_at": "2025-05-08T19:06:56+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa3959606", "title": "Why does experience replay require off-policy learning and how is it different from on-policy learning?", "url": "https://www.decisionsanddragons.com/posts/off_policy_replay/", "published_at": "2024-05-04T15:39:36+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa3cdf32a", "title": "What is the \"horizon\" in reinforcement learning?", "url": "https://www.decisionsanddragons.com/posts/horizon/", "published_at": "2024-04-21T20:49:00+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa3fb1ca7", "title": "Why doesn't Q-learning work with continuous actions?", "url": "https://www.decisionsanddragons.com/posts/q_learning_discrete_only/", "published_at": "2024-04-21T19:36:15+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa4a0b63c", "title": "Why is the DDPG gradient the product of the Q-function gradient and policy gradient?", "url": "https://www.decisionsanddragons.com/posts/ddpg_grad/", "published_at": "2024-04-20T16:51:21+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa5210a53", "title": "If Q-learning is off-policy, why doesn't it require importance sampling?", "url": "https://www.decisionsanddragons.com/posts/q_learning_doesnt_need_importance_sampling/", "published_at": "2024-04-03T03:43:37+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa54790c3", "title": "What is the difference between V(s) and Q(s,a)?", "url": "https://www.decisionsanddragons.com/posts/q_vs_v/", "published_at": "2024-03-31T03:24:52+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa5518de8", "title": "Why does the policy gradient include a log probability term?", "url": "https://www.decisionsanddragons.com/posts/why_does_the_policy_gradient_include_log_prob/", "published_at": "2024-03-30T00:07:54+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa5674d37", "title": "What is the difference between model-based and model-free RL?", "url": "https://www.decisionsanddragons.com/posts/model_free_vs_model_based/", "published_at": "2024-03-29T23:50:17+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa63f5af5", "title": "About", "url": "https://www.decisionsanddragons.com/about/", "published_at": "2024-03-27T00:17:59+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa6bf2158", "title": "Math Notation Cheatsheet", "url": "https://www.decisionsanddragons.com/notation/", "published_at": "2024-03-27T00:17:59+00:00" }, { "id": "01a0876a-94c5-72ca-8425-0bbfa6ef69f3", "title": "Revisions", "url": "https://www.decisionsanddragons.com/revisions/", "published_at": "2024-03-27T00:17:59+00:00" } ] posts Claim your blog
Back to decisionsanddragons.com
Blog · corpus.blog/blogs/decisionsanddragons.com/posts

decisionsanddragons.com

decisionsanddragons.com

2025

2024