AI Infra

Tags

#transformer

2posts

Day 03

Day 3 · Self-attention 到底在算什么:q、k、v、多头,以及模型怎么一个 token 一个 token 往外吐

把注意力机制拆到能手算的粒度:三个向量各干什么、权重怎么来的、加起来的到底是什么。用一个 3 token、head_dim 2 的例子把整张注意力矩阵算完,再接一段能跑的 numpy。顺带搞清模型为什么只能一个 token 一个 token 地生成,以及这件事怎么直接引出 prefill、decode 和 KV cache。

Day 02

Day 2 · Transformer 零件图:把 Llama-2-7B 的 6.74B 参数一个矩阵一个矩阵数出来

不靠任何公式表,只用「矩阵形状 = 输入长度 × 输出长度」一条规律,把 Llama-2-7B 的 6.74B 参数从头数到尾,再算出它在 fp16 下占多少显存。同一套算法顺手对账 13B、Llama-3-8B 和 TinyLlama-1.1B。