LLM 八股
2026/9/2小于 1 分钟
LLM 八股
LLM 是怎么自回归生成的?
该问题类似于 Transformer Decoder 是怎么自回归生成的
由于有 casual mask,当前词只能看到它与之前面的词来计算注意力,同时预测下一个词的概率分布,通常找概率最大的词作为下一个词,下一个词产生后,该词再与前面的词计算注意力,经 softmax 得到概率分布。
推理阶段,为什么 KV 能缓存,Q 不能缓存下来?
在推理阶段,权重矩阵 Wq,Wk,Wv 是固定的。当前词在 embedding 过后加上位置编码 乘以 Wq 作为 Q,与前面词的 K,V进行计算,得到自己的 attention 分布,然后预测下一个词,由于这种 casual attention 机制,当前次由前面的词决定而非后面的词,因此 KV 可以缓存下来,Q 在计算时只使用一次,因此缓存了也没用。