自回归生成:每个新 token 需要完整前向传播,推理延迟 ∝ 输出长度。
快 vs 好 vs 省 — 三者不可兼得:
Eagle3 (自回归): 质量好但慢 → 走到头了
DFlash (并行): 快但尾部长衰减 → 解决了速度,暴露了新问题
DSpark (半自回归+调度): 承认两个维度的瓶颈都真实存在,不拐弯抹角,各打各的
DSpark 的作者们意识到:这不是一个算法问题,是两个正交问题。
不是「让并行变自回归」——那是倒退。
而是「在并行的速度优势上,用最小的代价引入必要的信息」。
串行头只负责 token 间的「局部转移概率」——一个 token 到下一个 token 最自然的是什么——不参与完整语义建模。主干保留了并行的一次性全局生成能力。
并行生成了 8 个草稿 token,但第 7-8 个几乎肯定被拒绝。在高并发下,验证这两个「垃圾 token」消耗的 GPU 时间本该服务其他请求。
置信度头 (Confidence Head): 一个小型预测器,估算每个位置的「前缀存活概率」。
这不是固定的「验证 4 个还是 8 个」——每个请求、每个时刻、每个负载条件下的验证长度都不同。
就像高速公路的匝道信号灯:车少时全开,车多时分流。DSpark 的调度器读的是 GPU 的「交通状况」。
| 模型 | vs Eagle3 (自回归) | vs DFlash (并行) |
|---|---|---|
| Qwen3-4B | +30.9% | +16.3% |
| Qwen3-8B | +26.7% | +18.4% |
| Qwen3-14B | +30.0% | +18.3% |
| 模型 | 单用户加速 | 严格SLA下表现 |
|---|---|---|
| V4-Flash | +60-85% | 120 TPS — 基线崩溃,DSpark 保持 |
| V4-Pro | +57-78% | 50 TPS — 同上 |
大多数论文只有离线基准。DSpark 的作者把算法部署到 DeepSeek-V4 的生产系统,用真实用户流量做 A/B 测试。
这不是「我们觉得它有效」——是「我们的用户更快了,我们看到了」。
北大 + DeepSeek-AI 联合。ML架构、系统工程、推理优化三种能力齐聚。第一作者标注*等贡献=扁平协作。
DeepSeek-V4 已经在服务真实用户。不是实验室造了个原型——是在已运行的系统上改了一件组件并测量效果。
论文提到数据准备阶段需要为 Qwen3-4B 生成 38TB 的 target cache。这不是普通实验室能承受的存储/带宽。
默认配置假设单节点 8 GPU。DSpark 需要在目标模型的完整前向传播上训练草稿模型——需要同时加载目标模型和草稿模型。
DeepSeek 之前就有 MTP (multi-token prediction) 作为推理基线的经验。Eagle3、DFlash 的代码基础也复用了。不是从零开始。
不仅发论文——开源了完整 DeepSpec 训练管线 + DSpark checkpoint (V4-Flash/Pro)。这意味着结果可复现。
DSpark 是 AI 基础设施层的突破——它不直接创造新应用,但它让所有 AI 应用跑得更快、更便宜。
在我们的四层框架中,它属于认知能效率的提升:同样的 GPU,服务更多用户;同样的用户,获得更低延迟。