全国算力"接力跑":PD 分离破局延迟砍半
2026 年 7 月底,无问芯穹(Infinigence-AI)在 2026 WAIC 大会上首次公开了跨集群异构推理架构 PDD 的完整技术报告。这套以"P-RLD-MD"三级分离为核心的新型推理范式,在 DeepSeek-V4-pro 模型上用真实业务流量跑出了 P90 首字延迟下降 46%、整体性价比提升 37.5% 的成绩单——为长期被"广域网 KV Cache 传输"卡脖子的跨数据中心推理,提供了一个工程上彻底可行的解法。
一、为什么"跨集群 PD 分离"长期是伪命题
大模型推理有 Prefill(预填充)和 Decode(解码)两个阶段:前者算力密集,后者访存密集,硬件需求几乎完全相反。理论上最理想的方案是"异构分离"——把 Prefill 丢给算力强的卡、Decode 丢给显存带宽高的卡。
但现实里,要在同一集群里堆出大规模的异构算力,采购成本高得吓人;而一旦模型架构变化,原本精心配比的硬件就会出现部分闲置。于是业界很自然地把目光转向了已经分散在各地的存量同构集群:如果能用低成本的广域网以太网把这些集群串起来,做"跨集群异构分离推理",存量算力就能被重新激活。
想法很美,但工程上一动手就撞上了"叹息之墙":跨集群的 KV Cache 传输带宽和延迟,根本扛不住真实业务。无问芯穹的 PDD 架构,正是为攻克这一难题而设计。
二、破局前的三个"底层洞察"
在动手设计 PDD 之前,无问芯穹团队在技术报告的 Background 部分给出了三个关键发现,构成了整套架构成立的"地基"。
洞察 1:硬件的"极度偏科"。 内部基准测试显示,同一款芯片在不同推理阶段的表现可以天差地别——以 8 卡某旗舰高性能 GPU 为基线,某厂商的 E 芯片在 Prefill 阶段只能跑到 81% 的性能,到了 Decode 阶段却能爆发出 210%。把这类"偏科"芯片放进同构集群,既发挥不出长板,还会拖累 Prefill 效率。
洞察 2:DRC 把跨集群带宽打掉 10 倍。 智能体(Agent)业务的一个显著特征是前缀缓存命中率极高。利用这一特性,团队在 Decode 端部署了 RadixCache(DRC)。当 Prefill 端发现请求命中前缀缓存,就不必全量传 KV Cache,只需传"增量"即可——90% 平均命中率下,理论上能降低 10 倍的跨集群带宽需求。
洞察 3:命中率分布是"极度偏斜"的。 拉取 600 万条线上真实 Trace 分析后发现,70%-80% 的请求命中率都在 95% 以上,只有极少数低命中率请求会携带巨大的 KV Cache 数据包。微基准测试显示,这种偏斜分布下 P50 传输延迟只有 248 ms;而一旦假设命中率均匀分布,连接池瞬间被打满,P50 延迟飙升到 1210 ms——还多出 1682 ms 的排队时长。
第三个洞察尤为关键:极端长尾延迟只集中在极少数"刺头请求"上。这意味着,要解决跨集群 KV Cache 的延迟瓶颈,不需要全局优化网络,只要针对这少部分"刺头"做文章。
三、PDD 三级架构:一支 2×100 米的接力队
基于上述洞察,无问芯穹提出了 PDD(Prefill-RelayDecode-MainDecode)架构。传统 PD 分离只有 Prefill 和 Decode 两层,PDD 在中间插入了一个"中继站"——RelayDecode(RLD)实例。
整个系统被分成三层:
- P 实例:位于主集群,负责处理输入 Prompt,生成 KV Cache;
- RLD 实例:和 P 实例同机房,通过高速 RDMA 网络互联(传输延迟仅几十毫秒);
- MD 实例:位于远端集群,通过广域网以太网和主集群相连(传输延迟数秒到十几秒)。
它的工作方式像一场 2×100 米接力赛:P 实例算完 Prefill 后,同时干两件事——通过 RDMA 把 KV Cache 瞬间传给同机房的 RLD 实例,同时通过慢速以太网把 KV Cache 传给远端的 MD 实例。RLD 拿到 KV Cache 后立刻开始解码、输出 Token 给用户;几秒钟后 MD 实例收到完整 KV Cache,再把解码任务从 RLD 交接过来,由 MD 完成后续绝大部分的吐字工作。
用户在前端感受到的,是 RLD 通过 RDMA 抢出来的几十毫秒低延迟——根本感觉不到后台以太网还在传。PDD 实际上是用本地的 RLD 算力,去精准掩盖跨集群那极少数低命中率请求的网络延迟。
四、Extend-Decode Handoff:只传 Token ID,本地重算 KV Cache
三级架构听起来简单,但最大的工程难题在于:当 MD 实例准备好后,如何把 RLD 正在进行的解码任务无缝接管过来?
传统做法是,RLD 一边解码、一边把新生成的"增量 KV Cache"通过以太网传给 MD——但这又掉进了跨域网络延迟的坑里,还要经过繁琐的 H2D/D2H 拷贝。
无问芯穹提出了一个反直觉但极其高效的机制:Extend-Decode Handoff(扩展解码交接)。RLD 绝对不传庞大的 KV Cache,只把生成的"Token ID"传给 MD——几个 Token ID 仅仅是几 KB 的数据量,网络开销几乎为零。MD 收到 Token ID 后,利用 Extend-Decode 技术(常见于 MTP 多 Token 预测和投机解码)在本地重新计算对应的 KV Cache,同时生成下一个新 Token。
重算慢吗?这里又有个反直觉的硬件原理:Decode 阶段是访存密集型的,计算其实非常轻量。实测下来,MD 端重算 100 个 Token 的 KV Cache,平均耗时仅 305.2 ms,最大延迟 321.4 ms,标准差仅 4.8 ms——而传统走以太网传 KV Cache,平均 185.4 ms 一旦网络拥堵峰值飙到 512.6 ms,标准差 96.3 ms,还要再加 24.5 ms 的 H2D/D2H 开销。
通过"只传 Token、本地重算"的方式,无问芯穹把一个受网络波动影响极大、不可控的操作,变成了一个确定性的、可预测的本地计算操作。系统还设计了"追赶式"和"一次性"两种交接模式,可以根据 RLD 实时负载动态切换。
五、流水线编排:让 RLD 只"藏延迟"不"干重活"
RLD 虽然好用,但毕竟占用了宝贵的算力。团队的原则是:RLD 只负责"掩藏延迟",只给它极少数计算资源。基于命中率偏斜规律,他们设计了两条流水线:
- P-MD 流水线:命中率 > 95% 的高频请求(占 70%+),数据包极小,直接走以太网给 MD,根本不需要 RLD 中继;
- P-RLD-MD 流水线:只有命中率低、数据包大、传输必然卡顿的"刺头请求",才送去 RLD 掩盖延迟。
实测中,RLD 只承担了系统 6.2% 的 Token 生成任务,MD 包揽了 93.8%——负载差异高达 15.2 倍。这种设计还保证了 MD 端的缓存命中率始终和 P 端保持一致,避免了将请求生命周期终结于 RLD 所引发的恶性正反馈循环。
六、实战成绩单:降本增效的终极证明
架构再精巧,最终都要在真实业务压力下见真章。无问芯穹团队在 DeepSeek-V4-pro 上用真实 Agentic 工作负载 Trace,对 PDD 进行了全方位测试。基线是两种典型部署:跨集群异构 PD 分离(CDC-PD),以及单机房同构 PD 分离(IDC-PD)。
延迟维度:CDC-PD 的 P90 TTFT 飙到 18.3 秒、P99 逼近 30 秒;PDD 成功把传输延迟掩盖在 RLD 抢先输出阶段,P90 TTFT 降至 9.8 秒(下降 46%),P99 降至 14.4 秒。
负载维度:RLD 仅承担 6.2% 的 Token 生成任务(约 27 万个 Token),MD 包揽 93.8%(约 412 万个 Token)。
性价比维度:在严格的 SLA 约束下(P90 TTFT < 10 s,P99 < 15 s),PDD 相比 IDC-PD 在总成本下降 3.5%-7.1% 的前提下,RPS Goodput 反而提升 27.8%,最终性价比(BCR)提升高达 37.5%。
需要特别指出,这还不是 PDD 的极限。受限于测试资源,RLD 仅用了 3 个 GPU A 节点(这是以 DP 并行方式跑通 DeepSeek-V4-pro 的最小规模);如果部署规模进一步扩大,RLD 的固定开销会被摊薄;引入更极致的专用推理芯片后,性价比还有巨大提升空间。此外,实验中因为与 DRC 暂时不兼容,MTP 等关键优化机制尚未开启。
七、对下一代 MaaS 基础设施的启示
PDD 架构不仅仅是一个跨域以太网传输延迟优化技巧,它承载着无问芯穹对下一代模型即服务(Model-as-a-Service,MaaS)基础设施的核心设计理念——极简局部异构 + 灵活远端分离。未来,我们不需要在同一个机房里堆砌庞杂的异构芯片,只需在主集群部署少量算力强的卡做 Prefill,把绝大多数 Decode 工作交给远端同构集群——存量算力得以被充分释放,整个推理供应链的成本曲线和体验上限都将被重新改写。
无问芯穹已经把 PDD 技术报告完整公开在 GitHub(仓库地址 infinigence/pdd),并明确表示未来进展和公开材料都会在该仓库持续更新。在大模型推理成本依然是行业"生死线"的 2026 年,这支"接力跑"队或许正是打开下一阶段规模化的钥匙。
参考来源:
- 量子位《"接力跑"盘活全国算力,PD 分离终于破局:延迟砍半、成本直降近 40%》,2026-07-30
- Infinigence-AI《PDD: Unleashing Economical and Flexible Heterogeneous LLM Inference via Cross-Datacenter Prefill-Decode Disaggregation》技术报告,2026-07
- GitHub:
infinigence/pdd