SemiAnalysis 解释 LLM 自回归生成与输出成本
先了解这件事
AI 综述
2026年10月6日,SemiAnalysis 在 X 上发文解释 LLM 的自回归生成机制:模型逐 token 预测下一个词,最后一层实为词表上的分类器,每步输出概率分布并采样。该文同时说明输出 token 价格是输入的 3-5 倍的原因——输入可并行处理,而输出需逐个生成,每步都要重读全部模型权重和 KV cache,属于内存瓶颈。目前仅有这一篇报道,尚无后续进展。
报道时间线
10月6日
- SemiAnalysis 解释 LLM 自回归生成与输出成本
SemiAnalysis 解释 LLM 自回归生成机制:模型逐 token 预测下一个词,最后一层实为词表上的分类器,每步输出概率分布并采样。输出 token 价格是输入的 3-5 倍,因输入可并行处理,而输出需逐个生成,每步都要重读全部模型权重和 KV cache,属内存瓶颈。