DeepSeek 开源 DSpark:无损加速文本生成 DeepSeek 构建了一个推测解码模块将其生产模型的文本生成速度提升超过 50%且不牺牲准确性随后将该技术开源。新动态 北京大学和 DeepSeek 的 Xin Cheng 等人提出了 DSpark这是一种推测解码方法其中一个小模型称为草稿模块生成 tokens供大语言模型一次性验证。团队将 DSpark 应用于他们的 DeepSeek-V4 模型随后发布了 DeepSeek-V4-Pro-DSpark 和 DeepSeek-V4-Flash-DSpark 的 checkpoints这些 checkpoint 在 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 未改变的预览权重上增加了草稿模块。修改后的 DeepSeek 模型可在 Hugging Face 上以商业友好的 MIT 许可证免费下载。核心洞察 在 DSpark 所基于的推测解码技术中一个小的草稿模块提出一个 token 块由其服务的大模型一次性检查整个块。该次计算同时得出了大模型在每个草稿位置上的 next-token 选择因此它保留了与这些选择匹配的最长连续草稿 token 序列。这加速了文本生成而验证步骤则保持了文本质量。作者确定了影响速度的三个组件生成草稿 token 的成本、通过检查的草稿 token 数量以及大模型进行验证的计算量。早期的草稿器在第一和第二项之间做权衡而第三项无论服务负载如何都是固定的。DSpark 在三项上都有优化但它的主要贡献在于动态调整第三项——在服务器负载轻时做更多验证在负载重时减少验证。工作原理 DSpark 的草稿模块附加到更大的目标模型上目标模型保持冻结。DeepSeek 只训练了模块的三个部分一个草稿主干网络、一个小型顺序组件和一个置信度头confidence head因为该模块复用了目标模型的 embedding 层和输出头。在离线实验中团队将 Open-PerfectBlend 开放数据集中的提示输入目标模型并在目标模型的回答上训练草稿器。训练使草稿器匹配目标模型的 token 概率分布并教会置信度头估计每个 token 被接受的概率。作者采用了 DFlash另一团队早期的并行草稿器作为 DSpark 的主干。与 DFlash 类似DSpark 一次性为块中每个位置提出 token。无论块有多长一次计算的开销相同因此并行草稿器可以比逐 token 草稿器拥有更多层使其早期猜测更强。但由于草稿器独立预测每个位置它可能会在多个有效续写之间拼接不连贯的内容在作者的例子中当上下文可能续写 of course 或 no problem 时它可能拼接成 of problem。准确率在块末端急剧下降造成计算浪费。为了解决这个问题作者添加了一个顺序组件——一个作者称之为 Markov head 的紧凑查找器它仅根据前一个草稿 token 调整每个位置的 token 概率。例如在草稿器选择了 of 之后概率向 course 偏移而远离 problem。该步骤是逐 token 运行的但规模极小以至于将草稿长度从 4 个 token 扩展到 16 个 token每轮延迟仅增加 0.2% 到 1.3%与未修改的 DFlash 主干相比。对于每个草稿 token置信度头会估计该 token 在块中所有前面 token 都通过验证的条件下能通过验证的概率。这类估计往往过于自信而选择要验证多少个 token 需要真实的概率值而不仅仅是对强弱 token 进行排序。作者添加了一个校准步骤逐位置重新缩放这些估计值直到它们的链式乘积与保留数据上观察到的接受率相匹配。在服务时调度器将各位置的置信度估计值相乘因为一个草稿只有在其之前所有 token 都存活时才能存活到给定长度从而得出每种可能草稿长度的存活概率。然后调度器根据系统在每个负载水平上的速度配置文件启动时测量一次设置每个请求的验证长度以最大化所有用户的总期望输出。在流量轻时它验证较长的草稿以减少等待时间在流量重时它丢弃接受概率低的草稿 token为其他用户释放容量。结果 DeepSeek 在开放权重模型上对 DSpark 进行了离线评估对比自己重训练的早期草稿器版本并在生产环境中与之前的服务设置进行了对比。在所有情况下DSpark 都优于竞品草稿模块。DSpark 提高了每轮验证平均接受的 token 数这是衡量草稿质量的指标。与顺序草稿器 EAGLE-3 相比在 Qwen3-4B、Qwen3-8B 和 Qwen3-14B 上分别提升了 30.9%、26.7% 和 30.0%。与并行草稿器 DFlash 相比在同一组模型上分别提升了 16.3%、18.4% 和 18.3%。这些提升在 Gemma4-12B与 Qwen3 不同的模型家族上同样成立表明优势并非特定于某个模型系列。 在生产环境中与 DeepSeek 之前的 MTP-1每轮提出一个 token相比DSpark 使 DeepSeek-V4-Flash 为每个用户生成文本的速度提升了 60% 到 85%DeepSeek-V4-Pro 提升了 57% 到 78%。 DeepSeek 在不同硬件速度下对比了 DSpark 与其现有草稿模块。在 DeepSeek-V4-Flash 每用户每秒 80 tokens、DeepSeek-V4-Pro 每用户每秒 35 tokens 的情况下DSpark 使所有用户的总每秒生成 token 数分别提升了 51% 和 52%。在前者每用户保障 120 tokens/秒、后者每用户 50 tokens/秒的情况下提升分别达到了 661% 和 406%。实际上这意味着每用户生成速度提升了 60% 到 85%。DeepSeek 的旧草稿器在更高速度下几乎无法工作因此作者将这些数据解读为标记了新的可行运行点而不仅仅是加速。背景 Google Research 的作者在 2022 年首次描述了推测解码。该技术此后已广泛应用于生产服务中token 草稿模块的设计也层出不穷。早期的草稿器是顺序式的逐个生成草稿 tokenEAGLE-3DSpark 的对比对象就是以这种方式工作的它利用目标模型多个层的特征来预测每个新 token。随后并行草稿器通过一次性生成整个 token 块打破了顺序瓶颈DFlashDSpark 的主干来源使用一个小型扩散模型来实现其作者报告称速度提升可达 EAGLE-3 的 2.5 倍而 Nvidia 表示其在公司 Blackwell GPU 上推理可加速高达 15 倍。DSpark 保留了并行草稿器的速度和顺序草稿器的连贯性。DeepSeek 从 DeepSeek-V3 开始一直使用简单的顺序草稿器直到 DSpark——它结合了顺序和并行草稿器的优势——在 DeepSeek-V4 预览版发布两周后取代了之前的方案。为什么重要 部署模型输出的每个 token 都消耗服务提供商的成本并让用户等待这都限制了开发者能构建什么。常见的解决方案如使用更小或量化模型会牺牲准确性。DSpark 在不触碰模型权重或降低输出质量的情况下降低了成本和时间净效果是将增益转化为更便宜的 token 和更快的响应。我们的看法 DeepSeek 以低成本训练强大模型并通过开放论文分享强化学习推理模型等技术而闻名。我们很高兴他们也在优化模型服务并将成果和代码开源供所有人使用。https://www.iqiyi.com/v_1ssc2xsuxh8.htmlhttps://www.iqiyi.com/v_ozi27vw114.htmlhttps://www.iqiyi.com/v_1vn7vef8n4k.htmlhttps://www.iqiyi.com/v_2bh3dok6ws0.htmlhttps://www.iqiyi.com/v_1a2tzrzbavg.htmlhttps://www.iqiyi.com/v_20zqzandsks.html