56,966 blogs · [ { "id": "01a0d795-14a7-73a4-b7ce-647d7b0b061e", "title": "FlashAttention: Part 2", "url": "https://chizkidd.github.io//2026/09/17/flashattention-2/", "published_at": "2026-09-17T00:00:00+00:00" }, { "id": "01a0d795-14a7-73a4-b7ce-647d7bde739a", "title": "FlashAttention: Part 1", "url": "https://chizkidd.github.io//2026/09/13/flashattention/", "published_at": "2026-09-13T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93c9293cea", "title": "Mixture of Experts (MoE): How Transformers Scale Without Activating Everything.", "url": "https://chizkidd.github.io//2026/08/10/mixture-of-experts/", "published_at": "2026-08-10T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93c9375485", "title": "How Attention Became Efficient & Scalable: KV Caching, MQA, GQA, MLA, and Sparse Attention.", "url": "https://chizkidd.github.io//2026/08/05/attention-efficient-scalable/", "published_at": "2026-08-05T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93c9c35e74", "title": "Policy Gradient Methods: REINFORCE, Actor-Critic, and the Policy Gradient Theorem (S&B Ch. 13)", "url": "https://chizkidd.github.io//2026/05/07/rl-sutton-barto-notes-ch013/", "published_at": "2026-05-07T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93ca53bc7c", "title": "Transformer Architecture Explained: Self-Attention, Encoders, and Decoders", "url": "https://chizkidd.github.io//2026/04/17/transformers/", "published_at": "2026-04-17T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93cb20d371", "title": "SAM 2 Explained: Meta's Promptable Visual Segmentation Model", "url": "https://chizkidd.github.io//2026/04/17/sam-2/", "published_at": "2026-04-17T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93cb8ebd13", "title": "Muon Optimizer Explained: Newton-Schulz Orthogonalization Beyond Adam", "url": "https://chizkidd.github.io//2026/04/04/muon-muonclip/", "published_at": "2026-04-04T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93cb9d0493", "title": "Inkcast: Turn Any EPUB or PDF into an Audiobook in Your Browser", "url": "https://chizkidd.github.io//2026/03/16/inkcast/", "published_at": "2026-03-16T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93cc5e2323", "title": "Eligibility Traces Explained: TD(λ), Sarsa(λ), and the λ-Return (S&B Ch. 12)", "url": "https://chizkidd.github.io//2026/03/13/rl-sutton-barto-notes-ch012/", "published_at": "2026-03-13T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93cd043c48", "title": "The Deadly Triad in RL: Off-Policy Learning with Function Approximation (S&B Ch. 11)", "url": "https://chizkidd.github.io//2026/03/09/rl-sutton-barto-notes-ch011/", "published_at": "2026-03-09T00:00:00+00:00" }, { "id": "01a0875e-eecb-726f-8b39-fd93cd1fa82d", "title": "Semi-Gradient Sarsa and the Average Reward Setting in RL (S&B Ch. 10)", "url": "https://chizkidd.github.io//2026/03/09/rl-sutton-barto-notes-ch010/", "published_at": "2026-03-09T00:00:00+00:00" } ] posts Claim your blog
Back to chizkidd.github.io
Blog · corpus.blog/blogs/chizkidd.github.io/posts

chizkidd.github.io

chizkidd.github.io

2026