corpus.blog
Most cited
Talked about
Blogs
57,803 blogs · [ { "id": "01a08773-4ba7-735b-9741-01b219028967", "title": "Writing A Megakernel For LLM Decode - A Worklog", "url": "https://emre570.bearblog.dev/megakernel-decode/", "published_at": "2026-07-02T12:41:00+00:00" }, { "id": "01a08773-4ba7-735b-9741-01b219e44b43", "title": "Unleashing Blackwell's 4-bit: a surgical look at MXFP4 and NVFP4", "url": "https://emre570.bearblog.dev/blackwell-fp4/", "published_at": "2026-05-19T15:50:00+00:00" }, { "id": "01a08773-4ba7-735b-9741-01b21ad37d5b", "title": "From 429 GB/s to the DRAM wall: writing an FP8 quantizer on an RTX 5080", "url": "https://emre570.bearblog.dev/fp8-quantizer/", "published_at": "2026-05-13T15:02:00+00:00" }, { "id": "01a08773-4ba7-735b-9741-01b21adc1098", "title": "8.5x Faster Speech-to-Text: From 429ms to 50ms on a Single GPU", "url": "https://emre570.bearblog.dev/stt-blog-8x/", "published_at": "2026-05-07T14:18:00+00:00" }, { "id": "01a08773-4ba7-735b-9741-01b21ae45cd3", "title": "W8A16 Quantization with LLM.int8-Style Outlier Handling", "url": "https://emre570.bearblog.dev/w8a16-quantization/", "published_at": "2025-10-18T17:42:00+00:00" }, { "id": "01a08773-4ba7-735b-9741-01b21aefc5af", "title": "How Critical Are Outliers in Transformer Models? A Live Experiment - Phase 1", "url": "https://emre570.bearblog.dev/outlier-experiment/", "published_at": "2025-09-06T23:34:00+00:00" }, { "id": "01a08773-4ba7-735b-9741-01b21b57b004", "title": "Transformer Architecture: Building Blocks Explained", "url": "https://emre570.bearblog.dev/transformer-architecture-building-blocks-explained/", "published_at": "2025-03-24T22:04:00+00:00" } ] posts
Claim your blog
Back to emre570.bearblog.dev
Blog · corpus.blog/blogs/emre570.bearblog.dev/posts
emre570.bearblog.dev
emre570.bearblog.dev
2026
Writing A Megakernel For LLM Decode - A Worklog
original ↗
2 Jul 2026
Unleashing Blackwell's 4-bit: a surgical look at MXFP4 and NVFP4
original ↗
19 May 2026
From 429 GB/s to the DRAM wall: writing an FP8 quantizer on an RTX 5080
original ↗
13 May 2026
8.5x Faster Speech-to-Text: From 429ms to 50ms on a Single GPU
original ↗
7 May 2026
2025
W8A16 Quantization with LLM.int8-Style Outlier Handling
original ↗
18 Oct 2025
How Critical Are Outliers in Transformer Models? A Live Experiment - Phase 1
original ↗
6 Sept 2025
Transformer Architecture: Building Blocks Explained
original ↗
24 Mar 2025