跳到主要内容

浪潮信息单柜 4 万 Agent 部署技术拆解:CPU 原生液冷与多模型组队

2026 年 7 月 13 日,浪潮信息在 2026 开放计算大会(OCC)上一次性抛出三件武器:业界首款 CPU 原生液冷整机柜服务器、多模融合 API、以及元脑 SD200 超节点企业版。整套方案的核心理念是——AI 基础设施的核心任务,已经从支撑"大模型推理"转向支撑"海量 Agent 规模化运行"与"高质量 Token 的持续生产"。本文对其技术细节做一次完整拆解。

一、为什么 Agent 时代的基础设施要重做

IDC 数据显示,2025 年中国 AI Agent 企业级市场规模约 190 亿元,2025—2028 年复合增长率将超过 110%。Gartner 更直接预测:2026 年将有 40% 的企业应用集成任务型 AI Agent。

但 Agent 与传统大模型推理完全是两件事:

  • 推理:一次输入、一次输出,跑完即停;
  • Agent:任务拆解 + 工具调用 + 多轮协作 + 长时运行,背后可能是一整群 Sub-Agent 并行。

浪潮信息副总经理赵帅指出,AI 行业算力配比正在从"以 GPU 为中心"走向"多元算力系统协同"。原因在于 Agent 大量涉及整型运算、逻辑控制、任务调度、状态机——这些负载天然跑在 CPU 之上。

与此同时,AI 机柜功率正在急速攀升:国内今年内要冲到 300 千瓦,全球部分机柜已迈入兆瓦级。传统风冷单机柜 40—50 千瓦的散热上限早已被击穿,液冷成为必选项。

二、产品一:CPU 原生液冷整机柜服务器

2.1 关键指标

  • 单柜 CPU 数量:最多 384 颗(基于开放 OCM 架构,兼容 x86 与 ARM)
  • 单柜 Agent 规模:可支撑 4 万+ Agent 协同运行
  • 相比上一代:是 4 月发布的"企千虾"方案的 40 倍(彼时单台 2U 服务器承载 1000 个 OpenClaw Agent)

2.2 OCM 架构的价值

OCM(开放计算模组)是整套方案能成立的关键。浪潮信息把整机柜当成"计算模组的容器"来设计:

  • 兼容不同代际、不同架构的处理器(x86、ARM 自由混部);
  • 每一代新 CPU 出来不需要重做整机柜;
  • 整机研发周期被大幅压缩,企业可按需升级单颗 CPU。

2.3 整机柜"原生液冷"设计

传统液冷是"贴冷板 + 局部风冷"的混合方案——只给 CPU 装冷板,内存、网卡、SSD 还是用风扇散热。浪潮这次直接把整套思路推翻:

  • 冷板全覆盖:把内存、网卡、光模块、SSD 全部纳入液冷体系,所有发热部件一整块冷板统一承接;
  • 算力单元 2U 超薄:单节点 16 颗 CPU,主板上平铺所有 IO 部件;
  • 整机无线缆:原本被风扇、冷管、线缆占用的空间全部腾给计算与 IO;
  • 支持热维护:业务零中断,整机柜运维效率提升 100% 以上。

三、产品二:多模融合 API——让多个大模型组队答题

光把 Agent 跑起来不够,还要让它们"变聪明"。但实际任务往往太复杂,单一模型各有偏科——有的擅长逻辑推理、有的擅长文本生成——靠堆参数量解决不了能力偏科。

浪潮信息在元脑企智 EPAI 平台上推出"多模融合 API",其工作流分四步:

  1. 任务分发:把同一个任务同时甩给多个候选模型,让它们各自独立生成答案;
  2. 评审融合:由一个"评审融合模型"统一比较这些答案里的共识、分歧、遗漏与独特观点;
  3. 统一输出:拼出一份"博采众长"的最终回答;
  4. 分级路由:简单问答、工具调用、格式转换等短任务直接路由给轻量单模型,避免小题大做。

测试结果:这套机制在 DRACO 评测中拿到 53.9%,高于候选池里任何一个单模型的表现。多模融合 API 同时支持两种接入方式——既可以像普通模型服务一样直接调用,也可以配置到智能体和开发框架里,沿用原有的对话、推理、工具调用流程。

四、产品三:元脑 SD200 超节点企业版

多模型并行对底层算力提出了更高要求:一次要装得下多个万亿参数模型,又不能牺牲输出速度。这正是元脑 SD200 超节点要解决的问题。

4.1 关键性能指标

指标2025 年版2026 年版
同部署万亿参数模型4 个4 个
Token 生成时间8.9 ms4.77 ms(首个跑进 5 ms)
首 Token 延迟基线降低 35%

4.2 三大软硬协同优化

  • 多 Token 预测:解码阶段一次生成多个候选 token 再校验,减少逐字生成的轮次;
  • W4A8 精度方案:把 MoE 模块的计算精度从 BF16 降到 INT8,降低访存带宽压力;
  • JIT 即时编译:运行时根据张量形状动态生成专用 GPU 内核,让算力更贴合硬件特性。

4.3 企业版:把门槛拉低

SD200 超节点企业版把 Scale Up 计算域从 64 卡减到 16 卡,万亿参数模型首 token 延迟仍可降低 40% 以上。这给原本只能部署千亿模型做辅助的中小企业打开了"真正把万亿模型用进生产环境"的大门。

4.4 生态适配

目前 SD200 已完成对 Kimi K2.6、DeepSeek V4、GLM 5.2、MiniMax M3 等主流开源模型的适配,覆盖国内一线大模型主力。

五、Agent 时代基础设施的分工范式

这次发布传递出一个清晰的范式转变:CPU、GPU 与软件平台的分工正在变得更紧密、缺一不可:

  • 软件平台:负责模型接入、任务编排、资源调度、权限治理、结果融合;
  • CPU:承载 Agent 实例、工具调用、沙箱运行、业务系统交互;
  • GPU:负责模型推理与 Token 生成。

这条链路上任何一环掉队,整个 Agent 应用都跑不顺。这意味着 Agent 时代的基础设施竞争重点已经从"谁的单一模型支持更强"转向"谁的系统级协同做得更好"。

六、对企业落地 Agent 的三点启示

  1. 算力配比要重算:不再以 GPU 为唯一中心,CPU 侧的算力、内存、IO 都要为 Agent 重新配比;
  2. 多模型协同优于单模型堆参数:当任务复杂到一定阈值,让多个专精模型分工并融合输出,比硬刚一个超大模型更稳定、更便宜;
  3. 液冷不是可选项:当单机柜密度突破 50 千瓦、迈向 300 千瓦甚至兆瓦级,原生液冷已经从"节能加分项"变成"基础设施入场券"。

七、写在最后

浪潮信息这次方案并没有把"大模型更强"挂在嘴上,而是把焦点放在了 Agent 真正落地时绕不开的两个工程问题:规模化的稳定运行 + 多模型的协同提效。OCM 架构、原生液冷、多模融合、SD200 超节点企业版,这一连串工程化产品拼在一起,本质上是在为 Agent 时代搭建一套"操作系统级"的基础设施。

Agent 应用的护城河,从来不只在模型本身——更在它跑起来的那一层。


参考来源:

  1. 量子位:Agent 要数量也要脑子!浪潮信息一边单柜养 4 万 Agent,一边让大模型组队答题(qbitai.com,2026-07-13)
  2. 浪潮信息 2026 开放计算大会产品发布(OCC 2026)
  3. 浪潮信息官方:元脑企智 EPAI 平台技术白皮书
  4. 浪潮信息官方:元脑 SD200 超节点产品文档