直接答案:NVIDIA 当前 DGX Rubin NVL8 规格页列明,每台系统使用 2 颗 Intel Xeon 6776P 和 8 颗 Rubin GPU。旧稿标题中的“28 核”是错误的:Intel 产品页显示 6776P 为 64 核、128 线程,因此双路配置是 128 个 CPU 物理核心。这里的 CPU 是主机处理器,负责操作系统、编排、I/O 与数据准备,不能把它表述为替代 GPU 的“算力革命”。

这次发布确认了什么
| 项目 | 官方已确认 | 不能据此推出 |
|---|---|---|
| 主机 CPU | 2× Intel Xeon 6776P | x86 将取代 NVIDIA 自研 CPU |
| GPU | 8× NVIDIA Rubin | 所有 Rubin 系统都采用同一 CPU |
| GPU 内存 | 总计 2.3TB;美国英文页当前写 176TB/s,部分本地化页面仍写 160TB/s | 普通应用可直接使用全部容量,或不同语言页面数字已经同步 |
| 互连 | 第六代 NVLink,系统总带宽 28.8TB/s | CPU 到 GPU 的所有传输都达到该数字 |
| 整机功耗 | 约 24kW | 等于机房的完整供电与制冷预算 |
NVIDIA 还列出 8 个 ConnectX-9 VPI 端口、2 个 BlueField-4 DPU 和 4 套 NVLink Switch System。性能栏中的 400 PFLOPS 推理、280 PFLOPS NVFP4 训练及 140 PFLOPS FP8/FP6 训练属于指定精度下的密集规格,不能与不同精度、稀疏口径或应用端吞吐直接比较。
这是一份“初步规格”,不是冻结的采购配置
NVIDIA 产品页在规格表下明确标注“Preliminary information. All values are subject to change”,并把训练性能标为 dense specification。文章因此必须保存复核日期,不能只写“官方已经确定”。截至 2026 年 7 月 19 日,美国英文页写 176TB/s,而葡萄牙语、西班牙语、德语、意大利语、法语和日语页面仍显示 160TB/s;这更像页面版本尚未同步,不能擅自把其中一个数字解释成全球统一的最终规格。
| 主张 | 当前证据状态 | 引用时必须保留 |
|---|---|---|
| 2× Xeon 6776P、8× Rubin | NVIDIA 当前产品页明确列出 | 系统层级与复核日期 |
| 2.3TB、176TB/s | 美国英文产品页当前的总 GPU 内存与带宽;本地化页面仍有 160TB/s | 语言版本、复核日期和 preliminary 状态 |
| 400/280/140 PFLOPS | 指定 NVFP4、FP8/FP6 且为密集规格 | 工作精度与 dense 条件 |
| 28.8TB/s | NVLink Switch 总带宽 | 不能写成 CPU—GPU、网络或存储带宽 |
| 约 24kW | 单台系统功耗 | 不是整柜、制冷或机房总功耗 |
| 实际训练/推理速度 | 公开峰值规格不足以证明 | 模型、软件、序列、批量、并发与持续时间 |
NVIDIA 2026 年 4 月 20 日发布的Rubin NVL8 SuperPOD 参考架构提供了文档号和版本,可作为产品页之外的冻结证据。正式采购仍应以合同中的物料清单、数据表修订号和验收条款为准,而不是网页缓存。
6776P 的正确规格
Intel ARK 显示,Xeon 6776P 属于 Granite Rapids、Intel 3 制程,单颗 64 核 128 线程,基础频率 2.3GHz、最高睿频 3.9GHz、336MB 缓存、350W TDP;支持双路、8 个内存通道、DDR5 与 MRDIMM,单颗最大内存容量标为 4TB,并支持 PCIe 5.0。
这些是处理器 SKU 的能力上限,不等于 DGX Rubin NVL8 的整机内存配置。旧稿把 Xeon 6 家族“最高 128 核”、单 SKU 的 64 核、双路系统的 128 核,以及“最高 8TB 内存”混在一起,容易让读者误以为一颗 6776P 就有 128 核或整机必配 8TB 主存。
| 层级 | 正确写法 | 错误写法 |
|---|---|---|
| 单颗 6776P | 64 核、128 线程、350W TDP、最大 4TB(依内存类型) | 一颗 CPU 有 128 核或固定配 4TB |
| DGX 双路 CPU | 两颗共 128 个物理核心;线程数按启用配置理解 | 把双路核心数写成 Xeon 6 家族上限 |
| DGX GPU 内存 | 8 颗 Rubin 合计 2.3TB GPU 内存 | 把 GPU 内存与 CPU 主存相加成统一容量 |
| 整机系统功耗 | 产品页约 24kW | 用两颗 CPU 的 700W 推导整机功耗 |
| 机架/集群 | 按实际节点、PDU、网络与冷却方案核算 | 用单机 24kW 直接等同设施输入功率 |

为什么 GPU 系统仍需要强主机 CPU
大模型训练和推理的核心张量计算主要由 GPU 完成,但主机 CPU 仍要运行操作系统与控制面,准备数据,处理网络、存储、中断和进程编排,并把工作提交给加速器。CPU 不足可能在数据预处理、通信或并发服务中形成瓶颈;反过来,CPU 核心数很多也不能自动提高 GPU 利用率。
Intel 将这次入选解释为 x86 软件连续性、内存访问、模型安全和吞吐编排的价值;这是供应商的产品定位。NVIDIA 的产品页确认了具体配置,却没有声称 x86 已在所有高端 AI 服务器中取得“主导地位”。因此文章只保留可核验配置,不把一次产品选择扩展成市场份额结论。
CPU、GPU、NVLink、DPU 与外部网络各负责什么
| 组件 | 主要角色 | 对应指标 | 不能替代 |
|---|---|---|---|
| Xeon 主机 CPU | 操作系统、编排、数据准备、I/O 与控制面 | 核心、内存通道、PCIe、主机利用率 | GPU 张量计算 |
| Rubin GPU | 模型训练和推理的主要加速计算 | 指定精度性能、HBM 容量/带宽、利用率 | 完整数据管线与服务治理 |
| NVLink/NVSwitch | 同一系统内 GPU 间高速互连 | 系统内 GPU 互连总带宽 | 跨节点 InfiniBand 或存储网络 |
| ConnectX-9 | 跨节点计算网络连接 | 端口速度、拓扑、拥塞与集体通信 | 系统内 NVLink |
| BlueField-4 | 卸载和隔离网络、存储与安全服务 | 南北向/存储链路、DPU 资源和策略 | 主机 CPU 的全部职责 |
| 高性能存储 | 数据集读取、缓存、检查点写入 | 单节点与聚合读写、元数据、恢复时间 | GPU 内存 |
NVIDIA 的参考架构摘要将一个可扩展单元定义为 72 台 DGX Rubin NVL8,并明确包含 InfiniBand、Ethernet、存储、Mission Control 与支持体系。NVLink 官方说明把它定义为 GPU 间 scale-up 互连,而BlueField 产品页说明 DPU 主要加速网络、存储与安全基础设施。这说明 DGX 不是“把八块 GPU 放进服务器”这么简单;端到端结果由计算、互连、存储和运维共同决定。

采购与部署真正要问的六个问题
- 任务是什么:训练、后训练、离线批处理、实时推理或多智能体编排的瓶颈不同。
- 工作精度是什么:NVFP4、FP8/FP6 与实际模型支持要对齐,不能只比较 PFLOPS。
- 模型能否放下:同时计算权重、KV cache、激活、并发和框架开销;可参考站内Megatron Core 并行训练与显存验收。
- CPU 是否喂得饱 GPU:用真实预处理、检索、Tokenization 和网络链路压测,而不是按核心数推断。
- 机房能否承载:约 24kW 只是系统级标称,还要核对冗余供电、液冷、机架、网络与运维空间。
- 软件是否兼容:验证 DGX OS、驱动、容器、调度、监控和现有数据平台;不要把其他 DGX 型号的验证矩阵直接套到 Rubin NVL8。
从一台系统扩到机架时,功率不能只做乘法
NVIDIA 当前机架参考架构称,一种布局可在单柜放置 8 台 DGX Rubin NVL8,机架级功耗约 225kW,同时提醒应根据本地供电和冷却能力调整节点密度。8×24kW 只有 192kW,二者差额提示机架还包含供电、网络及设计余量,不能用单机标称简单替代设施规划。
参考架构还描述液冷与直流母线等条件。采购团队需要让设施、电气、暖通、网络、安全和平台运维共同签字:确认进线与冗余、冷却水参数、机柜承重、消防、维护通道、线缆数量、停电恢复和扩容边界。约 24kW 并不是“插上普通机柜电源即可运行”的承诺。
怎样把“初步规格”变成可执行的采购基线
NVIDIA 页面仍明确标注“Preliminary information. All values are subject to change”,因此采购文件不能只贴网页截图。建议建立一张带版本的规格台账,把“当前公开值”“供应商书面承诺”“到货实测值”分列保存;网页更新时保留旧快照和变化原因。176TB/s 是当前美国英文页给出的 GPU 内存带宽,而多语言旧值、营销摘要和媒体转述不能自动成为合同条款。
| 规格层级 | 当前公开信息 | 采购时要求 | 到货后怎么验 |
|---|---|---|---|
| CPU | 2× Xeon 6776P;单颗 64 核 | 确认具体 SKU、数量、内存配置和固件 | 读取硬件清单、NUMA、频率、内存通道和 PCIe 拓扑 |
| GPU 与 HBM | 8× Rubin,聚合 2.3TB,当前英文页 176TB/s | 把精度、dense 口径和 preliminary 状态写入附件 | 核对 GPU 数量、可见容量、错误状态和带宽测试方法 |
| 互连与网络 | 第六代 NVLink、28.8TB/s 总带宽、ConnectX-9 与 BlueField-4 | 区分机内 NVLink、计算网络和管理网络 | 分别测试 GPU 集合通信、跨节点通信、链路降级与恢复 |
| 功率与冷却 | 单机约 24kW,参考机架为高密度液冷设计 | 要求机柜、母线、液冷、冗余和环境条件 | 在目标负载下测整机、机架和设施侧功率及温度 |
| 软件 | 产品页列出 DGX OS、Ubuntu、RHEL、Rocky | 要求交付版本、驱动、固件、支持周期和升级路径 | 用供应商支持矩阵和目标工作负载做回归,不套用旧 B/H 系列矩阵 |
对“峰值性能”也要保存计算精度、dense/sparse、单机或集群、训练或推理等限定。400 PFLOPS NVFP4 推理、280 PFLOPS NVFP4 训练和 140 PFLOPS FP8/FP6 训练并不是三项可以任意互换的通用速度;真实吞吐还受模型结构、批量、并行策略、内存、网络、存储和软件版本影响。
如何验证主机 CPU 没有拖慢 GPU
“CPU 负责喂数据”只是概括,必须用分阶段指标证明。训练任务要观察数据读取、解码、预处理、Host-to-Device 传输、GPU 利用率、集合通信和检查点写入;推理任务还要观察分词、调度、KV cache 管理、网络请求和后处理。只看 CPU 总利用率会掩盖 NUMA、单线程、内存带宽或 PCIe 局部瓶颈。
| 测试场景 | 需要记录 | 可能的 CPU/主机瓶颈 | 通过标准 |
|---|---|---|---|
| 训练稳态 | 每步时间、GPU 活跃率、数据等待、CPU 核与 NUMA 分布 | 数据加载线程、解码、内存带宽或跨 NUMA 访问 | 目标规模下步时稳定,GPU 不长期等待主机 |
| 分布式通信 | 集合通信带宽、尾延迟、重试与链路错误 | 网卡绑定、IRQ、PCIe 拓扑或进程亲和性 | 达到经双方约定的方法与容差,故障后可恢复 |
| 检查点 | 写入时长、训练暂停时间、文件大小和恢复时长 | 文件系统元数据、缓存、网络和序列化 | RPO/RTO 与训练阻塞均满足业务目标 |
| 在线推理 | 首 Token、输出速率、P95/P99、排队和并发 | 分词、请求编排、后处理或网络栈 | 目标并发下质量、延迟、错误率和成本同时达标 |
| 混合故障 | 单 GPU、单链路、单存储路径异常 | 主机恢复流程、驱动重置或资源残留 | 告警准确、任务可迁移或恢复、审计记录完整 |
测试模型必须代表真实业务。大模型并行训练可结合Megatron Core 指南设计张量、流水线和数据并行用例;低延迟推理可参考Groq LPU 选型文章中的首 Token、持续输出和业务结果分离方法。两篇文章提供的是验收思路,不是对 Rubin NVL8 的实测替代品。
交付验收要留下哪些证据
一套可复查的交付包应包括硬件清单、序列号、固件与驱动版本、机柜和网络拓扑、液冷参数、基准命令、原始日志、失败样本、修复记录、支持工单和回滚步骤。NVIDIA 当前 Rubin 参考架构已经描述 Mission Control 等管理组件,但现行 11.x 验证矩阵尚未把 Rubin 列入 B300/B200/H200/H100 的支持范围;可阅读NVIDIA Mission Control 文档了解管理能力,同时向供应商索取 Rubin 对应的正式支持组合。
| 验收阶段 | 证据 | 不能接受的替代 |
|---|---|---|
| 到货核验 | SKU、数量、拓扑、固件、功率和冷却连接 | 只看外箱、报价单或营销截图 |
| 单机基线 | GPU/CPU/内存/互连健康检查与原始日志 | 只给一个峰值分数 |
| 集群基线 | 集合通信、存储、调度、故障注入和恢复 | 把单机结果乘节点数 |
| 业务验收 | 目标模型、数据、并发、精度、延迟、成本与人工复核 | 用厂商样例替代业务工作负载 |
| 运维交接 | 监控、告警、备件、升级、支持边界和应急手册 | 只承诺“后续支持”而没有责任与时限 |
普通模型团队也可以借用这套证据结构。先从模型选型与验收方法明确任务和质量门槛,再用自然语言处理任务指南定义输入、输出和评测集,最后才选择硬件。硬件规格很强不等于任务质量自动合格,反过来,模型效果好也不能证明设施容量、恢复与支持已经通过。
这条新闻对普通开发者意味着什么
它说明下一代 DGX 仍把成熟的 x86 主机环境作为一种交付路线,同时用 Rubin、NVLink、DPU 和网络构成加速数据路径。它不意味着个人开发者需要购买同等级硬件,也不证明任意智能体项目会因为更强服务器而自动获得更高质量。小规模部署应先用真实请求测延迟、吞吐、并发和成本,必要时比较本地服务器、云 GPU 与托管 API。
继续评估时,可从AI 导航查找官方工具入口,从AI 教程专题了解部署基础;如果方案涉及可执行任务链,还应先阅读AI 智能体与自动化专题中的权限和回滚边界。
正式发布前怎样监控规格变化
本篇计划在 2026 年 7 月 28 日发布,届时要重新检查 NVIDIA 英文产品页、Intel ARK、Rubin x86 SuperPOD 参考架构和最新验证组件矩阵。复核不能只比较页面更新时间,而应把 CPU 型号与数量、GPU 数量、HBM 容量与带宽、不同精度性能、NVLink、网络端口、系统功率、软件列表和 preliminary 声明逐项做差异。任何关键值变化,都要同步修改正文、图表、摘要和结构化数据;不能只改正文而留下旧图。
如果 176TB/s 再次变化,先确认单位、页面语言、缓存和是否为聚合 GPU 内存带宽,再记录旧值、新值、来源 URL 与访问时间。若供应商撤下 preliminary 标记,也不自动等于采购合同已经冻结;仍需向销售和交付团队索取书面 BOM、支持矩阵、验收方法和变更机制。相反,如果页面临时无法访问,应保留最近快照并把结论降级为“此前公开”,不要用搜索摘要代替原页。
上线后的更新也必须留下痕迹:注明哪项规格改变、对采购或部署判断有什么影响、哪些图和表已重绘,以及是否需要通知已引用本文的读者。若只是链接重定向而事实未变,也要检查 canonical 与新页面内容是否一致。这样 AI 摘要或搜索结果截取单段文字时,仍能看到当前版本和证据边界。
当前公开资料还没有回答什么
产品页给出了整机级主要规格,但没有替代针对具体模型的端到端基准。公开信息不能回答你的数据管线能否持续喂满 GPU、某个量化格式是否被完整支持、不同并发下首 Token 延迟如何变化,也不能给出机房改造、维保、网络和软件订阅后的完整总拥有成本。NVIDIA 还明确标注规格可能变更。
截至 2026 年 7 月 19 日,DGX SuperPOD 11.x 最新验证组件矩阵明确只覆盖 B300、B200、H200 和 H100,并未把 Rubin NVL8 列入适用平台。因此,不能把该表列出的驱动、DGX OS、Base Command Manager 或 Run:ai 版本当作 Rubin 已验证兼容性的证据。采购方应要求供应商提供针对具体 Rubin 硬件修订的正式支持矩阵、升级顺序和回滚路径。
因此,采购验收应要求供应商写清硬件修订、固件与驱动版本、测试模型、精度、输入输出长度、批量、并发、持续运行时间和故障恢复条件。至少保留一次满负载温度与功耗记录、一次节点或链路故障演练,以及同一业务样本在现有平台和候选平台上的对照结果。没有这些条件,“峰值快多少倍”不能成为最终采购结论。
| 验收域 | 最低证据 | 失败时的判定 |
|---|---|---|
| 硬件身份 | 物料清单、序列号、固件、CPU/GPU/NIC/DPU 实际枚举 | 与合同修订不符则不得签收 |
| 计算 | 固定模型、精度、序列、批量、并发和持续运行 | 只提供峰值规格不算业务验收 |
| 网络 | 单链路/聚合吞吐、延迟、拥塞、故障切换 | 端口速率不能替代端到端结果 |
| 存储 | 数据读取、检查点写入、元数据与恢复 | GPU 等待 I/O 时应定位而非怪罪模型 |
| 设施 | 峰值功率、温度、流量、压差、告警和冗余演练 | 超出设计或无法恢复则不得上线 |
| 软件与运维 | 驱动、DGX OS、容器、调度、监控、补丁与回滚 | 版本漂移无法重现则暂停变更 |
存储不能被忽略。NVIDIA 的高性能存储指南明确区分标准与增强型工作负载,并提醒大模型检查点的同步写入可能阻塞训练。团队应先测自己的文件大小、重读模式和检查点周期,再确定带宽与容量,而不是直接照抄参考表最高档。
资料来源与纠错
DGX Rubin NVL8 的双路 6776P、8 GPU、内存、性能、互连、功耗与网络规格依据NVIDIA 当前产品页;6776P 核心、线程、频率、内存和 TDP 依据可稳定访问的Intel 中国产品规格页;系统构成与部署语境参考NVIDIA DGX SuperPOD 组件说明、网络架构说明和DGX SuperPOD 部署指南。当前发布说明中的验证组件矩阵尚不适用于 Rubin NVL8,不能假设硬件相近就允许复用其中任意驱动和调度组件组合。资料复核日期:2026 年 7 月 19 日。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日复核。旧稿的“刚刚”、28 核、未经当前稳定链接支撑的事件日期、“内存带宽提升 2.3 倍”、端到端硬件加密、无需重构软件栈、x86 主导地位和对 AMD 的确定性影响等表述,或与官方规格冲突,或超出一手来源支持,已删除;本次新增规格版本台账、CPU 瓶颈验证、交付证据包、规格变化监控,以及“当前 11.x 验证组件矩阵尚未覆盖 Rubin”的软件边界。美国英文页当前写 176TB/s,多个本地化页面仍写 160TB/s;该页继续标注初步规格,采购前必须按合同版本重查。本站的来源、更新与纠错原则见关于本站与编辑规范。
正式发布前将重新核对英文规格页、Intel SKU 页面、Rubin 参考架构、支持矩阵与三张原创图,并记录逐项差异。
