DeepSeek DSpark 开源:投机解码把推理速度翻了一倍
2026-06-28
说实话,我看论文这几年,很少有一篇让我盯着屏幕愣了三秒的。
DeepSeek 这次放出的 DSpark,不是又发了个新模型——比那有意思多了。他们做的是投机解码(Speculative Decoding)的一种全新实现,跑在自家的 DeepSeek-V3 和 R1 上,直接把推理吞吐量翻了一倍。
怎么说呢。这玩意儿让我想起去年折腾 GLM-5.2 的时候——跑个长文档推理,看它一个字一个字往外蹦,跟挤牙膏似的。
卡——死——了。
先聊聊投机解码到底是什么意思。这个概念其实不复杂:大模型推理的时候,每生成一个 token 都要跑一次完整的前向传播,计算量巨大。投机解码的思路是——搞一个"小模型"先快速生成一批候选 token,然后用大模型做一次验证。如果小模型猜对了,一批 token 一次性通过,省掉多次大模型计算。
我原本以为这只是一个简单的"小模型投机、大模型验证"的流水线优化。DSpark 看完发现根本不是这么回事。
嗯,这差距有多大呢。
传统投机解码有两个痛点。第一个是"猜对率"——小模型猜得越准,加速效果越好,但小模型能力有限,碰到复杂推理场景猜对率直线下降。第二个是"批处理"——投机解码天然不适合做批量推理,因为不同请求的生成路径不同,很难统一处理。
DSpark 最骚的操作是引入了"动态投机策略"——不是固定用小模型投机,而是根据当前的推理难度动态调整投机长度和候选策略。模型觉得简单就多猜几步,觉得难就少猜几步。
冲了一杯咖啡——周五下午就是这样——然后继续看论文的技术细节。
更具体说,DSpark 搞了一个双层架构:
第一层是"轻量投机器"——一个极小的 draft model,只负责快速生成 token 候选序列。这一层追求的是速度,不是质量。
第二层是"验证器合并"——把传统投机解码中的"单独验证"步骤合并进大模型的推理过程中,减少额外的计算开销。
关键看 KV Cache 优化。传统投机解码需要维护两个模型的 KV Cache,内存开销翻倍。DSpark 通过共享 KV Cache 和内存池技术,把额外开销压到了几乎可以忽略的程度。
我拿手头的项目做了个粗略估算。跑 DeepSeek-R1 做代码生成,传统推理每秒大概输出 25-30 tokens。DSpark 的数据说能把吞吐提升到 55-65 tokens/s——翻了一倍还不止。
谁在乎?反正写代码的人在乎。
但这东西是不是完美?不是。我跑了几轮测试——用自己的本地 DeepSeek 蒸馏版——发现在数学推理场景下,投机解码的猜对率确实不如预期。模型在推理解题步骤时,每一步都依赖上一步的输出,小模型很难提前猜中。
矛盾是吧?但吃过亏的人就懂。投机解码在生成式任务(写文章、翻译、对话)上效果很好,但在严格推理任务上,小模型根本猜不到大模型要走哪条推理路径。
DSpark 论文里也承认了这一点——他们展示的加速数据主要在代码生成和通用对话场景,数学和逻辑推理场景的加速比明显低一些。
这才是做研究该有的诚实。不像某些厂商发的 PR,全程"我们的模型啥都好",PPT 谁都会做。
好了。技术层面讲完了。
DSpark 的架构还有一个值得单独说说的设计——他们用的是"交错验证"而非传统的"批量验证"。简单说就是大模型在验证小模型生成的候选 token 时,不是等全部候选生成完再一次性验证,而是边生成边验证,进一步减少了等待时间。
这个设计理念很有意思——"减少等待"比"减少计算"在某些场景下更有效。因为 GPU 计算的核心瓶颈往往不是 FLOPS,而是 memory bandwidth。投机解码正好把计算密集型的小模型生成和 memory-bound 的大模型验证做了异构调度。
嗯,有那味儿了。
我看了 DSpark 的 benchmark 数据——在 A100 80G 上,针对 DeepSeek-V3,投机解码的加速比在 1.8x 到 2.2x 之间,取决于任务类型。代码生成 2.1x,问答 1.9x,长文档摘要 1.6x。
等一下。这里有陷阱。加速比是相对什么基线?论文对比的是传统的自回归解码,但这本身不是最公平的基线——因为工业界已经在用各种优化技术了(vLLM、TensorRT-LLM 等)。如果是跟 vLLM 比,加速比大概在 1.3x 到 1.5x 之间。
做技术的人得说实话。1.3x 在实践中也是巨大的——等于你零成本把推理集群的吞吐提升了 30%。而且 DeepSeek 把 DSpark 开源了,代码在 GitHub 的 DeepSpec 仓库里。


我原本以为投机解码这条路已经快走到头了。毕竟去年以来各家都在做——Medusa、SpecInfer、Eagle 等等,各种变体都发过了。DSpark 让我改观了:原来还有"动态策略 + 交错验证"这条没被挖透的路径。
说白了。大模型推理优化现在就像早期 CV 领域的模型剪枝——看起来该做的都做了,但每次新技术出来都能再挤出一倍性能。
如果你在跑 DeepSeek 系模型,或者想优化自家推理服务的延迟,现在就可以去看 DSpark 的代码。开源的,直接能落地。
至于效果嘛——反正我下周一就准备在测试环境上试试。

关于维基框架
维基框架(Wiki Framework)是一套面向复杂业务场景的轻量级开发框架,支持多语言、多协议、多部署形态。适用于企业级应用开发、微服务架构、云原生部署等场景。
- 官网:https://framewiki.com
- Gitee:https://gitee.com/wiki-framework
- GitHub:https://github.com/wiki-framework
- 示例项目:https://gitee.com/cdkjframework/framewiki-example
- 📄 许可证:MulanPSL-2.0(木兰宽松许可证,第2版)