教程 / 实战普通
如何让 LLM 提速 3 倍:投机解码原理详解
原始标题:How to Make LLMs 3X Faster
内容摘要
投机解码通过让一个小模型预先草拟多个候选 token,再由大模型在单次前向传播中并行验证,可将生成速度提升 2-3 倍,且输出在统计上与单独运行大模型完全一致。70B 参数模型每生成一个 token 需从 GPU 内存读取约 140 GB 权重,而生成阶段计算利用率仅 20-40%,投机解码正是利用这部分闲置算力。文章还探讨了草稿来源的四种方式及投机解码失效的场景。