# 大模型与 AI Factory:GB200/NVL72、认证 Hypervisor 与平台争夺 日期:2026-09-03 ## 场景定义 “大模型”在本卷宗指需要 **多 GPU 规模互连、机架级铜互连、专用存储与电力** 的生产负载: - 70B+ 密集模型或千亿/万亿 MoE 的训练、持续预训练、长上下文推理。 - **AI Factory**:NVIDIA 提出、Omdia/OEM 沿用的说法——以 Token 生产为中心的超高资本密度机房,而不是传统虚拟化集群上插几张卡。 - **认证 Hypervisor**:NVIDIA-Certified Hypervisors 项目,用计算/内存/数据路径/LLM 推理一组负载对比裸金属与纯 KVM 基线,验证“虚拟化后仍接近裸金属”。 与小模型卷宗的分工:单卡 7B–32B、embedding、分支推理见 `small-models.md`。本卷宗是 **GPU 机柜 + 多租户 IaaS + 私有 AI 云**。 ## 为何现在重要 - **资本与叙事已经离开传统机房。** Next Platform 转述 Omdia:全球数据中心投资到 2030 年将接近 1.6 万亿美元;**“今年”科技企业 AI 基础设施支出超过 6000 亿美元**——这是分析师预测/转述,不是我方测算。[Next Platform 2026-09-01](https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559) - **Dell 把企业 Agent 写成 2028 最大负载。** 截至 2026-07-31 季度:营收 470 亿美元;AI 优化服务器收入 164 亿美元;订单 609 亿美元;积压 950 亿美元(均为 Dell 财报数字,经 Blocks & Files 转述)。Clarke:**厂商观点** “enterprise agentic is expected to be the single largest workload by 2028”。[Blocks & Files](https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866) - **虚拟化重新被允许进入 AI Factory,前提是认证。** 2026 年 NVIDIA 正式推出 Certified Hypervisors;vSphere 9.1、Mirantis k0rdent、Rafay、OpenNebula 均宣布通过 GB200 NVL72 或 HGX/NVL72 轨道。没有认证,neocloud / 主权云招标会把软件层直接写成 NVIDIA 参考架构 + 裸金属。 - **VMware 用 Private AI Cloud 把“留下 VCF”绑定到 AI。** Explore 2026:VCF 9 之上叠 Private AI Cloud 与 AI Factory(model-as-a-service),MetalSoft 编排从金属到模型。这是 Broadcom 对“一半用户计划减量”的高端对冲。 ## 2025–2026 动态 ### VMware Private AI Cloud / AI Factory - 发布场合:VMware Explore 2026 拉斯维加斯。基础是 VCF 9;ReadyNode 来自 Dell、Cisco、Lenovo、Supermicro 等;加速器含 NVIDIA 与 AMD Instinct MI350 + ROCm。**厂商自称** NVMe memory tiering 可降每主机成本至多 42%。[Next Platform](https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559) - vSphere 9.1 成为 NVIDIA-Certified Hypervisor,覆盖 Blackwell 与 Hopper;测试类别含 GPU 集合通信、带宽、计算、推理、RDMA、拓扑映射。[VCF 博客](https://blogs.vmware.com/)(抓取:`vmware-cloud-foundation-achieves-nvidia-certification-ai-workloads-val-89712ca8.txt`) - 安全与 Agent:AI Gateway、安全沙箱、TrueSource、vDefend、Avi;Tanzu 作为 Agent 层,deny-by-default 沙箱。AgentMinder 同周 GA(见 `agent-ready.md`)。 ### Cisco Secure AI Factory:机架规模外包给 Supermicro Cisco 把 Secure AI Factory with NVIDIA 扩到 Supermicro 液冷/风冷机架,宣称符合 NVIDIA Cloud Partner 参考架构;前端 Cisco Silicon One N9300,后端 N9100 + Spectrum-X;映射 NVL72(Vera Rubin / Grace Blackwell)、HGX NVL8(Rubin / B300)、MGX PCIe。企业架构 <~1000 GPU,云架构 1000–100000+ GPU。**厂商计划 2026-10 通过 Cisco 渠道开卖**,物理维修仍由 Supermicro 做。Cloud Control 统一管理目标日历 2026 Q4。[STH](https://www.servethehome.com/cisco-secure-ai-factory-with-nvidia-expands-to-supermicro-rack-scale-systems/) 含义:网络巨头承认自研 UCS 迭代跟不上 GPU 代际,HCI/虚拟化软件若还按“三年认证一台四路服务器”会错过整机柜窗口。 ### 认证 Hypervisor 三家挑战者(2026 夏) **Mirantis k0rdent AI** - 首批 NVIDIA-Certified Hypervisors,GB200 NVL72 + Grace CPU 轨道;此前已是 NVIDIA AI Cloud Ready ISV。 - 强调机架级拓扑:NVLink scale-up + Quantum IB / Spectrum-X scale-out,NUMA/GPU 亲和。 - VMaaS 为 **技术预览**;同时卖 BMaaS 与 K8s。虚拟化卖点是租户隔离与分钟级回收 vs 物理机 15–20 分钟重启。[Mirantis](https://www.mirantis.com/blog/mirantis-k0rdent-ai-certified-through-the-nvidia-certified-hypervisors-program/) **Rafay** - 2026-08-27:Rafay VMaaS 通过认证,覆盖 HGX 与 NVL72。定位是 GPU PaaS / Token Factory,把裸金属、VM、K8s、Slurm、推理服务做成可计量的多租户消费层。[Rafay](https://rafay.co)(抓取 `rafay-achieves-nvidia-certified-hypervisors-status`) **OpenNebula** - OpenNebula 7.2 完成 GB200 NVL72 **ARM 轨道**认证:PCI 透传 + 虚拟机内跑 OneKS(Elastic Kubernetes)。路线是“虚拟化工作环境,但不虚拟化加速器数据路径”。[OpenNebula](https://opennebula.io/blog/product/opennebula-validation-gb200-nvl72/) NVIDIA AI Enterprise 支持矩阵仍写明:GB200 NVL4/NVL72、GB300 NVL72 **不要求 NVIDIA-Certified Systems,而要求 Qualified server**;DGX GB200 NVL72 在部分表中仍标 bare metal only。认证 Hypervisor 与“整机认证”是两张表,写标书时不能混。[NVAIE 8.1 Support Matrix](https://docs.nvidia.com/ai-enterprise/release-8/8.1/support/support-matrix.html) ### OpenShift AI Red Hat 把 OpenShift + OpenShift AI 写成企业 Agent 的“操作系统”:多集群、GPU、MCP、HITL。推理侧推 vLLM 与 llm-d。相对 VMware/Nutanix,它是 **K8s 原生**,VM 通过 OpenShift Virtualization(KubeVirt)。适合已有 OpenShift 的应用团队,而不是 vSphere 管理员的第一跳(除非同时买虚拟化迁移)。[Red Hat](https://www.redhat.com/en/blog/agentic-ai-red-hat-openshift-what-enterprises-are-doing-right-now) ### 互连:NVSwitch 仍是 scale-up 事实标准,但标准在围攻 Next Platform 2026-08-31:Nvidia 滚动 12 个月 InfiniBand 销售额估约 257.4 亿美元,Ethernet+NVSwitch 合计约 256.7 亿美元(**作者估算,不是 Nvidia 分项财报**)。判断:大规模集群的 IB 可能已接近峰值,企业与模型公司倾向 Ethernet;scale-up 目前 NVLink/NVSwitch 仍占绝对多数,UALink / ESUN 在挑战。MediaTek 获 35 亿美元可转债投资以采用 NVLink Fusion,说明 Nvidia 在用资本把自定义 XPU 拉进自己的机架。[Next Platform NVSwitch](https://www.nextplatform.com/connect/2026/08/31/in-the-long-run-nvidia-nvswitch-is-the-infiniband-of-scale-up-ai-networks/5293474) [STH MediaTek](https://www.servethehome.com/nvidia-and-mediatek-ink-3-5b-investment-deal-accelerate-nvlink-fusion-adoption/) HCI 软件进 NVL72 的前提是 **正确暴露拓扑**(CPU–GPU–NVLink–网卡),而不是再做一层存储 HCI。 ## 谁在卖什么 | 厂商 | 产品 | 角色 | 2026 状态 | | --- | --- | --- | --- | | Broadcom VMware | VCF 9 + Private AI Cloud + AI Factory | 企业私有 AI 云全栈 | Explore 2026 发布;vSphere 9.1 认证 Hypervisor | | NVIDIA | GB200/GB300 NVL72、NVAIE、Certified Hypervisors | 硬件+软件资格 | Qualified server ≠ Certified system | | Cisco | Secure AI Factory + Supermicro 机架 | 网络+验证+渠道 | 计划 2026-10 开卖 | | Dell / HPE / Lenovo / SMC | OEM AI Factory / ReadyNode | 出货主力 | Dell 本季 AI 服务器收入 164 亿美元(财报) | | Red Hat | OpenShift AI | K8s AI PaaS | Agent 蓝图 + vLLM | | Mirantis | k0rdent AI | K8s 原生 IaaS + VMaaS | NVL72 认证;VMaaS 预览 | | Rafay | Rafay Platform / Token Factory | GPU PaaS | HGX+NVL72 认证 | | OpenNebula | 7.2 + OneKS | 基础设施优先云 | GB200 ARM 透传认证 | | Nutanix | NCP + NKP + NAI | 企业双原生 | 大模型多节点仍预览;更偏 8B 与 Agent | ## 客户要什么 vs 缺口 **要什么** - 多租户:把一张 NVL72 切给多个团队而不掉集合通信性能。 - 接近裸金属的 NCCL/NVLink 性能 + VM 的隔离、快照、快速回收。 - 从金属到模型的一体交付(Cisco CVIS、VMware+MetalSoft、OEM rack)。 - 主权与审计:模型、权重、日志不出境。 - 电力/液冷/光模块一起设计,而不是 IT 单独买服务器。 **缺口** - GB200 级仍以 **PCI 透传** 为主,vGPU/MIG 在 NVL72 上不是主故事;多租户粒度常常是“整 GPU 或整计算盘”。 - 认证轨道分裂:x86 HGX vs Grace ARM NVL72,国内若无 Grace 货,认证证书不能直接复用。 - HCI 分布式存储几乎肯定不是 checkpoint / KV Cache 的最优路径(见 `data-domain.md`)。 - 中国客户还要昇腾超节点并行故事;只讲 CUDA 过不了信创标。 ## 对我方产品规划的可执行含义 1. **把“NVIDIA-Certified Hypervisor”列为 2026–2027 硬件生态 KPI**,至少覆盖:HGX B200/B300 透传、拓扑感知调度、NCCL 回归。没有证书就不要在 AI Factory 标书里写“近裸金属”。 2. **产品拆成两层报价:** 企业双原生(对标 Nutanix/VCF 业务+小模型) vs AI Factory 管理面(对标 k0rdent/Rafay/OpenNebula)。用同一套 HCI 节点硬扛 NVL72 会同时输给两边。 3. **调度必须拓扑感知。** k0rdent 公开强调 NVLink 与 Spectrum-X 的放置;这应成为 GPU 调度的默认,而不是可选亲和性标签。 4. **透传是 NVL72 的诚实默认,vGPU 留给 L40S/L4/分支。** 与 `ai-ready.md` 一致。 5. **与 OEM 机柜绑定参考架构**(液冷、Spectrum-X/IB、对象存储),不要只认证一台 2U 四卡。Cisco–Supermicro 说明渠道会买“整柜+验证报告”。 6. **国产轨道单独做。** 昇腾超节点、华为 Atlas 与 NVIDIA 认证是两套资格;混在一个“AI 就绪”开关里会在政企标书被废标。 ## 出处 - VMware Private AI Cloud:https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559 - Dell 财报转述:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866 - Cisco Secure AI Factory:https://www.servethehome.com/cisco-secure-ai-factory-with-nvidia-expands-to-supermicro-rack-scale-systems/ - k0rdent 认证:https://www.mirantis.com/blog/mirantis-k0rdent-ai-certified-through-the-nvidia-certified-hypervisors-program/ - OpenNebula GB200:https://opennebula.io/blog/product/opennebula-validation-gb200-nvl72/ - NVAIE 支持矩阵:https://docs.nvidia.com/ai-enterprise/release-8/8.1/support/support-matrix.html - NVSwitch 评论:https://www.nextplatform.com/connect/2026/08/31/in-the-long-run-nvidia-nvswitch-is-the-infiniband-of-scale-up-ai-networks/5293474 - NVIDIA–MediaTek:https://www.servethehome.com/nvidia-and-mediatek-ink-3-5b-investment-deal-accelerate-nvlink-fusion-adoption/ - OpenShift agentic:https://www.redhat.com/en/blog/agentic-ai-red-hat-openshift-what-enterprises-are-doing-right-now