SemiAnalysis_· @SemiAnalysis_ · X·· 1 天前AI 评分
SemiAnalysis 解释 LLM 自回归生成与输出成本
SemiAnalysis 解释 LLM 自回归生成机制:模型逐 token 预测下一个词,最后一层实为词表上的分类器,每步输出概率分布并采样。输出 token 价格是输入的 3-5 倍,因输入可并行处理,而输出需逐个生成,每步都要重读全部模型权重和 KV cache,属内存瓶颈。
大语言模型(LLM)以自回归方式生成文本。它预测下一个词元(token),然后重复这一过程:
🟠 <start> -> "The" -> "The capital" -> "The capital of" -> "The capital of New" -> "The capital of New York" -> "The capital of New York is" -> "The capital of New York is Albany" -> "The capital of New York is Albany."
为简单起见,这里假设 1 个单词 = 1 个词元,但实际的分词器可能会把单词拆分成多个子词片段。LLM 的最后一层从技术上说是一个针对整个词表的分类器,只不过它会反复执行这个分类步骤。每一步都会输出一个覆盖所有词元的概率分布,并从中进行采样。
这就是为什么输出词元的成本总是比输入词元高 3-5 倍。输入词元是并行处理的,而输出词元在解码阶段是逐个生成的——这个过程受内存带宽限制,因为每一步都必须重新读取所有模型权重和 KV 缓存。(2/3)
来源:SemiAnalysis_ · x.com