欢迎访问本站,持续更新中…

DeepSeek DSpark 开源:投机解码把推理速度翻了一倍

2026-06-28

说实话,我看论文这几年,很少有一篇让我盯着屏幕愣了三秒的。

DeepSeek 这次放出的 DSpark,不是又发了个新模型——比那有意思多了。他们做的是投机解码(Speculative Decoding)的一种全新实现,跑在自家的 DeepSeek-V3 和 R1 上,直接把推理吞吐量翻了一倍。

怎么说呢。这玩意儿让我想起去年折腾 GLM-5.2 的时候——跑个长文档推理,看它一个字一个字往外蹦,跟挤牙膏似的。

卡——死——了。

先聊聊投机解码到底是什么意思。这个概念其实不复杂:大模型推理的时候,每生成一个 token 都要跑一次完整的前向传播,计算量巨大。投机解码的思路是——搞一个"小模型"先快速生成一批候选 token,然后用大模型做一次验证。如果小模型猜对了,一批 token 一次性通过,省掉多次大模型计算。

我原本以为这只是一个简单的"小模型投机、大模型验证"的流水线优化。DSpark 看完发现根本不是这么回事。

嗯,这差距有多大呢。

传统投机解码有两个痛点。第一个是"猜对率"——小模型猜得越准,加速效果越好,但小模型能力有限,碰到复杂推理场景猜对率直线下降。第二个是"批处理"——投机解码天然不适合做批量推理,因为不同请求的生成路径不同,很难统一处理。

DSpark 最骚的操作是引入了"动态投机策略"——不是固定用小模型投机,而是根据当前的推理难度动态调整投机长度和候选策略。模型觉得简单就多猜几步,觉得难就少猜几步。

冲了一杯咖啡——周五下午就是这样——然后继续看论文的技术细节。

更具体说,DSpark 搞了一个双层架构:

第一层是"轻量投机器"——一个极小的 draft model,只负责快速生成 token 候选序列。这一层追求的是速度,不是质量。

第二层是"验证器合并"——把传统投机解码中的"单独验证"步骤合并进大模型的推理过程中,减少额外的计算开销。

关键看 KV Cache 优化。传统投机解码需要维护两个模型的 KV Cache,内存开销翻倍。DSpark 通过共享 KV Cache 和内存池技术,把额外开销压到了几乎可以忽略的程度。

我拿手头的项目做了个粗略估算。跑 DeepSeek-R1 做代码生成,传统推理每秒大概输出 25-30 tokens。DSpark 的数据说能把吞吐提升到 55-65 tokens/s——翻了一倍还不止。

谁在乎?反正写代码的人在乎。

但这东西是不是完美?不是。我跑了几轮测试——用自己的本地 DeepSeek 蒸馏版——发现在数学推理场景下,投机解码的猜对率确实不如预期。模型在推理解题步骤时,每一步都依赖上一步的输出,小模型很难提前猜中。

矛盾是吧?但吃过亏的人就懂。投机解码在生成式任务(写文章、翻译、对话)上效果很好,但在严格推理任务上,小模型根本猜不到大模型要走哪条推理路径。

DSpark 论文里也承认了这一点——他们展示的加速数据主要在代码生成和通用对话场景,数学和逻辑推理场景的加速比明显低一些。

这才是做研究该有的诚实。不像某些厂商发的 PR,全程"我们的模型啥都好",PPT 谁都会做。

好了。技术层面讲完了。

DSpark 的架构还有一个值得单独说说的设计——他们用的是"交错验证"而非传统的"批量验证"。简单说就是大模型在验证小模型生成的候选 token 时,不是等全部候选生成完再一次性验证,而是边生成边验证,进一步减少了等待时间。

这个设计理念很有意思——"减少等待"比"减少计算"在某些场景下更有效。因为 GPU 计算的核心瓶颈往往不是 FLOPS,而是 memory bandwidth。投机解码正好把计算密集型的小模型生成和 memory-bound 的大模型验证做了异构调度。

嗯,有那味儿了。

我看了 DSpark 的 benchmark 数据——在 A100 80G 上,针对 DeepSeek-V3,投机解码的加速比在 1.8x 到 2.2x 之间,取决于任务类型。代码生成 2.1x,问答 1.9x,长文档摘要 1.6x。

等一下。这里有陷阱。加速比是相对什么基线?论文对比的是传统的自回归解码,但这本身不是最公平的基线——因为工业界已经在用各种优化技术了(vLLM、TensorRT-LLM 等)。如果是跟 vLLM 比,加速比大概在 1.3x 到 1.5x 之间。

做技术的人得说实话。1.3x 在实践中也是巨大的——等于你零成本把推理集群的吞吐提升了 30%。而且 DeepSeek 把 DSpark 开源了,代码在 GitHub 的 DeepSpec 仓库里。

DSpark 架构图:投机解码的双层流程图,左侧轻量投机器快速生成候选 token,右侧大模型做交错验证,中间用 KV Cache 共享连接,深色科技风格

推理速度对比图:左侧传统自回归解码 25-30 tokens/s,右侧 DSpark 投机解码 55-65 tokens/s,暗色 UI 风格配青色高亮

我原本以为投机解码这条路已经快走到头了。毕竟去年以来各家都在做——Medusa、SpecInfer、Eagle 等等,各种变体都发过了。DSpark 让我改观了:原来还有"动态策略 + 交错验证"这条没被挖透的路径。

说白了。大模型推理优化现在就像早期 CV 领域的模型剪枝——看起来该做的都做了,但每次新技术出来都能再挤出一倍性能。

如果你在跑 DeepSeek 系模型,或者想优化自家推理服务的延迟,现在就可以去看 DSpark 的代码。开源的,直接能落地。

至于效果嘛——反正我下周一就准备在测试环境上试试。

深夜里开发者盯着终端屏幕查看 LLM 推理日志,GPU 指标在背景闪烁,桌上咖啡杯冒着热气,显示器光映在脸上

关于维基框架

维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。