ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

解码策略和投机解码

2026/8/27 8:34:56 拓冰建站 浏览量
解码策略和投机解码 datawhale社区Datawhale-学用AI从此开始llm-algo-leetcode教程地址datawhalechina/llm-algo-leetcode: LLM algorithm practice lab with theory, solutions, and test cases.《大模型算法与系统教程》面向大模型入门到进阶的算法实战教程覆盖原理讲解、答案解析、测试用例与 CUDA/Triton 实战。解码策略模型会输出下一个token的概率分布解码策略需要平衡“确定性”和“多样性”三种核心控制策略Temperature在 Softmax 前将 Logits 除以 T。T 1 使概率分布更集中(输出更确定)T 1 使分布更平缓输出更随机。Top-K仅保留 Logits 中得分最高的K个词其余位置的 Logits 强制置为 -inf。Top-p按概率降序排列并计算累积概率截断累积概率超过阈值p之后的所有词。三种策略能够组合使用Top-K 能设定一个绝对的安全上限比如防止词表很大时计算过于繁重而 Top-p 能在候选词概率非常集中或非常分散时灵活调整候选数量Temperature 负责调控全局的随机倾向。投机解码核心原理与痛点痛点自回归生成慢的主要瓶颈在于大模型必须逐个 token 地前向推理。原理引入一个轻量级的“草稿模型”先连续猜出K个候选 token再由“目标大模型一次性验证。验证与接受概率公式接受条件对于草拟token小模型预测概率为q大模型预测概率为p若 pq直接接受。若 pq则以p/q的概率接受。终止策略一旦某个草拟 token 被拒绝系统将立刻停止验证后续的草稿 token并交还给大模型重新采样。这种带终止条件的接受-拒绝采样保证了最终输出分布与纯大模型生成完全一致。传统自回归生成K个 token投机解码生成 $K$ 个候选 token 并验证这样通过减少大模型的Forward次数用小模型做 K次单 token的生成来节省时间