投机解码新突破:JetSpec 实现近十倍推理加速
引言:LLM 解码的串行瓶颈
现代自回归大语言模型在数学、代码、Agent 推理等场景中需要长链路生成,解码阶段的串行特性是主要延迟来源。投机解码(Speculative Decoding, SD)通过"先草稿、后并行验证"加速这一过程,已成为业内主流的低成本推理优化方案。
投机解码的"因果—效率两难"
SD 存在一个根本性的 scaling ceiling(扩展天花板):增加 draft budget(草稿预算)只有在"接受率高 + 起草开销低"的前提下才能转化为实际加速。现有 head-based 方法(将草稿头附加在目标模型上的方案)始终面临一个两难:
- 自回归起草器(EAGLE 系列):能产出高质量的 path-conditioned(路径条件)候选,但起草成本随树深度线性增长;
- 双向块扩散起草器(DFlash):单次前向生成所有位置,但分支无关的边缘分布可能形成"单独合理却互不一致"的候选树,浪费预算、降低接受率。
JetSpec 的核心创新
2026 年 6 月,阶跃星辰(StepFun)联合 UC San Diego、浙江大学、UIUC、南京大学发布 JetSpec(论文 arXiv:2606.18394v3),打破这一两难。三个关键设计:
- 因果并行草稿头(causal parallel draft head):在一次前向中预测多个树节点;
- 块级因果注意力(block-level causal attention):对冻结目标模型的融合隐藏状态施加块级因果注意力;
- 路径条件分布对齐:让每个分支的草稿分布与目标模型的自回归分解对齐,候选树评分真正反映目标模型的 path-conditioned 概率。
结果:更大的草稿预算稳定地转化为更长的接受前缀与更高的端到端加速比。
实验数据:H100 上 9.64× 加速
JetSpec 在数学、代码、对话三大基准上系统对比 DFlash、DDTree(DFlash 的树变体)以及 EAGLE 系列基线,覆盖 Qwen3 密集与 MoE 模型:
- H100、MATH-500、最高加速 9.64×;
- H100、MATH-500、256 tokens 高预算:平均接受长度 τ=10.7,端到端 9.5× 加速;
- H100、MT-Bench、高预算:τ=5.9,超过 4× 加速;
- 编码与数学任务:实测 1000+ TPS(tokens per second),最长接受长度 10×。
低预算(16 tokens)下 JetSpec 与基线持平;高预算(256 tokens)下领先优势被显著放大——证明 JetSpec 真正把"draft budget"扳成了"accepted length"。
工业级集成与工程意义
- 已在 vLLM 推理引擎中原生集成,论文附录 E 给出完整工程实现;
- 覆盖 H100 与 B200 两种 GPU 平台,针对不同请求率测试;
- 小到中等服务负载下持续优于 DFlash、DDTree、EAGLE 系列基线;
- 在 B200 等高端 GPU 上增益更显著,提示算法与硬件协同优化空间;
- 蒸馏训练开销低于 10 亿 token,部署改造成本可控。
行业影响
DeepSeek 推出 DSpark(宣称单用户 TPS 提升 85%)后不久,阶跃星辰即发布 JetSpec,标志着大模型推理效率竞赛进入"算法 + 硬件协同优化"新阶段。对 Agent 高频调用、长链路推理这类典型负载,JetSpec 直接把首 token 之后每一步的延迟拉低一个数量级,是 2026 年 LLM 服务栈的重要进展。