Day 30 · M1 总复习:一页笔记、20 道全月自测、错题本汇总与 M2 预告
把 M1 四周加加餐周压成一页:W1 的账本、W2 的计时与 profiler、W3 的实测屋顶、W4 的环境流水线、加餐周的硬件与数值地基。然后合上笔记做 20 道全月自测,把三十天的错题按形状、单位、异步、标称、计费五类归根,对照 Day 0 的目标逐条打勾,最后写 M2 的预告。
The premise
A GPU only reaches its headline TFLOP/s when a kernel does enough arithmetic per byte it moves. Single-sequence decode does about one FLOP per byte — under 1 % of what an A100 needs to climb off the memory roof. Nearly every serving win starts there.
365-day study log
从 transformer 零基础开始,每天一篇。已写到 Day 30:M1 总复习:一页笔记、20 道全月自测、错题本汇总与 M2 预告
把 M1 四周加加餐周压成一页:W1 的账本、W2 的计时与 profiler、W3 的实测屋顶、W4 的环境流水线、加餐周的硬件与数值地基。然后合上笔记做 20 道全月自测,把三十天的错题按形状、单位、异步、标称、计费五类归根,对照 Day 0 的目标逐条打勾,最后写 M2 的预告。
拿真实招聘要求对照 Day 0 定的路线:样本从哪来、有多不完整,JD 里反复出现哪些词,哪些是路线图已经覆盖的、哪些是缺口。由此在路线图上加了六个勾,记下薪资快照和四条必须正视的限制。不改骨架,只补缺口。
A100 宣传页写 624 TFLOPS,Day 5 用的却是 312;同样叫 A100 80GB,SXM 和 PCIe 的带宽差 5%,ridge point 一个 153 一个 161;NVLink 和 PCIe 差十倍。把规格表上每个会骗人的数字过一遍,最后把小时价换算成每一百万 token 多少钱,看 batching 在账单上是多大的杠杆。
一个 kernel 是怎么被切成几千个 block 撒到 SM 上跑的,warp 为什么是 32,stream 为什么是有序队列,以及每次 launch 都要付的那笔固定税有多大。把 Day 11 在 timeline 上看到的 gap 追到它的物理来源,顺手给 M5 的 Triton 铺好路。
前面四周所有的「× 2 字节」都默认了 fp16。今天把这 16 个位拆开看:几位给符号、几位给指数、几位给尾数,换一种分法就是另一个格式。然后回答两个实际问题:为什么 T4 跑 bf16 会出事,以及把权重压到 8 位、4 位之后 decode 上限从 150 tok/s 变成多少。