AI Infra

Tags

#kernel

2posts

Day 27

Day 27 · CUDA 执行模型:kernel、grid、block、warp、stream 与 launch 开销

一个 kernel 是怎么被切成几千个 block 撒到 SM 上跑的,warp 为什么是 32,stream 为什么是有序队列,以及每次 launch 都要付的那笔固定税有多大。把 Day 11 在 timeline 上看到的 gap 追到它的物理来源,顺手给 M5 的 Triton 铺好路。

Day 10

Day 10 · torch.profiler 抓一次 generate,在 Perfetto 里看懂 timeline

计时器只给一个数,profiler 给每个 kernel 的名字和时长。今天把 Day 9 那个比值拆开:一步 decode 里 GPU 真正在跑的是哪几个 kernel,各对应模型的哪一部分,CPU 那边又在干什么。