2026-06-29 · 🧠 模型← 本期
DeepSeek 发布 V4-Pro-DSpark 模型 + DeepSpec 全栈开源代码库
DeepSeek 历史上的开源通常意味着公布模型权重和基本使用说明——V4-Pro-DSpark 与 DeepSpec 的组合改变了这一模式,第一次将从训练到推理的完整工具链纳入开源范围。对 infra 团队来说,权重是起点,但真正决定能否在自有系统上高效运行的,是推理框架本身。
V4-Pro-DSpark 的规模参数:1.6T 总参数、49B 激活参数、1M token context 窗口。49B 激活的 MoE 设计意味着单次推理的实际计算量与 49B dense 模型相当,但总容量达 1.6T——这是目前开源模型中容量与效率比最高的梯队之一。1M context 对需要处理长文档或超长代码库的应用场景有直接价值。
DeepSpec 的核心是三个组件。Eagle3 是 DeepSeek 自研的 speculative decoding(投机解码)框架——原理是用小模型快速生成草稿 token,再用大模型批量验证,从而在不损失输出质量的前提下提升吞吐。DSpark 是专为 V4-Pro-DSpark 优化的 speculative decoding 实现,与 Eagle3 配合使用。DFlash 则是 Flash Attention 的 DeepSeek 优化实现,专为其内存布局和 MoE 路由特性定制。
DFlash 已合并进 llama.cpp 主线,这一点的实际影响不容忽视。llama.cpp 是目前本地推理生态覆盖最广的运行时,DFlash 进入主线意味着其性能优化将惠及整个 llama.cpp 生态,而不只是 DeepSeek 用户。
三大组件对 Qwen3(4B/8B/14B)和 Gemma4 12B 的支持,说明这套工具链的设计目标不局限于 DeepSeek 自家模型。从生态建设角度看,DeepSeek 正在从模型提供方向推理基础设施提供方延伸——类似 vLLM、SGLang 在做的事,但结合了 DeepSeek 自身的工程积累。
发布后 3 天 2416 stars,按开源社区的习惯,这一速度处于中高水位,核心受众是对推理效率有需求的 MLOps 和 infra 工程师,而非泛化的 AI 开发者。
局限:DeepSpec 目前针对 DeepSeek 架构的 MoE 特性做了专项优化,在其他架构上的迁移成本尚不明确。Eagle3 和 DSpark 的实际加速比受硬件配置影响较大,官方数字需在具体环境下验证。