AI Infra

Tags

#tensor-core

3posts

Day 25

Day 25 · GPU 解剖:SM、tensor core、寄存器/shared/L2/HBM 到底是什么

前四周一直在说「算力」和「带宽」,今天把这两个词拆开看里面的零件:算力是多少个 SM 里多少个 tensor core 每个时钟做多少次乘加,带宽是一座五层的存储金字塔里最底下那一层。312 TFLOP/s 和 2039 GB/s 这两个数,今天要能从零件表里亲手算出来。

Day 17compute-bound

Day 17 · 标称 vs 实测:哪些 kernel 能打到屋顶,哪些永远打不到

把 Day 13、14 测出来的带宽和算力跟规格表并排放,算清标称值是怎么来的、实测为什么差那一截。再给每种 kernel 算一遍算术强度,标到 roofline 上:大矩阵乘能碰到屋顶,elementwise、softmax、norm 这些永远贴着斜线的底部,而这正是 M5 要写 fused kernel 的全部理由。

Day 14compute-bound

Day 14 · 实测峰值算力:大方阵 matmul 能打到几成

昨天测了斜线,今天测屋顶。用大方阵矩阵乘法把 T4 真正能算多快测出来:FLOPs = 2MNK 除以时间。坑比带宽多:矩阵不够大打不满、fp32 的标称是另一个数、fp16 要真走 tensor core 才对得上 65 TFLOPS、A100 的 624 是稀疏值。顺手算出方阵多大才跨过 ridge point。