点左侧专题。场景 / 技术栈 / 产业链分栏。每日追踪在「每日追踪」。
产业情报总图(2026-09-03)
面向中国 HCI / 虚拟化产品规划:短期锁定 VMware 替代,长期对齐 下一代业务托管、AI PaaS、AI 工作负载 三根柱子。本目录各篇为 2026-09-03 起从原始抓取页与公开网页重写的独立卷宗,不继承旧分析稿。
口径
- 财务、份额、TAM、单价:只引用带出处的第三方报道或厂商财报数字;未核验的数字一律不写。
- 厂商宣传能力、性能、市占:标注 厂商自称。
- 日期基准:2026-09-03。
两层时间轴
| 时间层 | 买方问题 | 产品规划焦点 |
|---|---|---|
| 短期:VMware 替代 | VCF 9 捆绑、vSphere 8.x 支持窗口(Virtified / The Register 引述至 2027-10)、许可审计、异构 hypervisor 并存 | 迁移工具、多 hypervisor 纳管、2 节点 HA、dHCI/外置存储、边缘 SKU 地板 |
| 长期:三根柱子 | 业务系统仍以 VM 为主、AI 推理与 Agent 要靠近数据、GPU 与电力成为约束 | 双原生(VM+容器)、认证 Hypervisor、MCP/Agent 治理、向量/对象/KV Cache 数据域、国产加速器 |
三根柱子如何落到产品
- 下一代业务托管:不是“再卖一套 vSphere 替代”,而是把 VM、K8s、外置存储、边缘 2 节点、多租户自服务收成同一控制面。Gartner 2026-08 企业存储 MQ 已把 hypervisor 换平台与存储采购绑在一起(见
dhci.md、data-domain.md)。 - AI PaaS:模型即服务、私有推理、<8B 微调、MCP 网关、租户隔离沙箱。Nutanix NAI 2.8、VMware Private AI Cloud、OpenShift AI / AgentOps、ZStack Zentrix 都在抢这一层(见
small-models.md、agent-ready.md、runtime.md)。 - AI 工作负载:GB200/NVL72 级 AI Factory、认证 Hypervisor、vGPU/MIG/透传、昇腾/海光/寒武纪、液冷与电力。这层不再是传统 HCI 节点能“顺带支持 GPU”的问题(见
large-models.md、ai-ready.md、hardware.md、ai-chain.md)。
卷宗地图
| 文件 | 主题 | VMware 替代 | 业务托管 | AI PaaS | AI 工作负载 |
|---|---|---|---|---|---|
| dhci.md | 解聚 HCI;NVMe/TCP vs FC;Nutanix 外置存储;vSAN Storage Clusters;HPE Alletra;Dell VxRail 战略后撤 | 主路径:保住 SAN 投资、换 hypervisor | 计算/存储独立扩 | 次要 | 外置高性能存储喂推理/训练 |
| small-models.md | 7B–32B / 蒸馏 / embedding / 分支 GPU | 替代后的“第一波 AI”落点 | 与现有 VM 同集群 | 主路径 | 单卡/小集群推理 |
| large-models.md | AI Factory、GB200/NVL72、认证 Hypervisor、Private AI Cloud、OpenShift AI、k0rdent/Rafay/OpenNebula | 高端客户留 VCF 的理由 | 多租户 GPU IaaS | 模型目录 | 主路径 |
| data-domain.md | DB / 备份对象 / 向量 / lakehouse vs HCI vs 三层 | 存储绑定是换平台最大摩擦 | 数据库与备份仍要块/文件 | RAG/向量是 PaaS 底座 | KV Cache、checkpoint、S3 |
| edge.md | ROBO、2 节点 HA、NCI-Edge、Scale、Azure Local、VCF Edge 地板 | 中小站点离开 VMware 的主战场 | 分布式业务托管 | 边缘 SLM | 边缘推理/机器人 |
| ai-ready.md | 认证 Hypervisor、vGPU/MIG/透传、NVAIE、国产加速器 | “能跑 AI”成为选型门槛 | GPU 分时给业务+AI | vGPU 给开发/推理 | 主路径 |
| agent-ready.md | MCP 网关、Agent 治理(AgentMinder / Nutanix Agent Gateway / OpenShift AgentOps) | 新控制面,不是 hypervisor 功能清单 | Agent 调 ERP/CMDB | 主路径 | 沙箱与隔离消耗 CPU/内存 |
| hardware.md | Blackwell/GB200、AMD MI、昇腾、海光、寒武纪、Gaudi;Xeon 6 / Turin / 鲲鹏 / 飞腾 | 信创替代绑定 CPU | 主机规格 | 分支 GPU/NPU | 主路径 |
| runtime.md | K8s / Kata / gVisor;Firecracker / microVM / Agent sandbox;KVM/QEMU;AWS 嵌套虚拟化 | KVM 路线的运行时差异 | 双原生 | Agent 沙箱 | GPU 透传到容器 |
| ai-chain.md | 芯片/光模块/液冷/电力/IDC/模型/应用 | 成本与交期冲击传统 HCI 扩容 | 内存/NAND 涨价 | 推理 TCO | 主路径:供给约束 |
| emerging.md | 2026-09 新能源、核聚变、脑机、机器人、创新药、智驾、能源循环 | 间接 | 行业云/边缘站 | 行业小模型 | 私有云 GPU / 边缘 / 数据域需求 |
| daily/2026-09-03.md | 当日追踪:摘要 + 原文摘录 | 信号源 | 信号源 | 信号源 | 信号源 |
阅读顺序(规划用途)
- 先读本页与
daily/2026-09-03.md,对齐当日事实。 - 短期路线:
dhci.md→edge.md→data-domain.md→runtime.md。 - 长期路线:
small-models.md→agent-ready.md→ai-ready.md→large-models.md→hardware.md→ai-chain.md。 - 行业外溢:
emerging.md只回答“哪些会变成私有云 / GPU / 边缘 / 数据域订单”。
七条可执行规划信号(跨卷宗)
- SAN 客户不会为了换 hypervisor 先换存储。Nutanix+NetApp NFS(EA,厂商自称 GA 目标 2026 Q3)、vSAN Storage Clusters、HPE Alletra dHCI 说明:dHCI / NVMe/TCP 是 VMware 替代的默认架构选项,不是可选项。
- 2 节点 HA + 许可地板决定边缘胜负。VCF Edge 9.1 要求最少 10 站点、单站点最多 256 核;Scale 本地 witness、Azure Local 双节点、NCI-Edge 25 VM 上限,把中小 ROBO 让给软件 HCI。
- 认证 Hypervisor 已成 AI Factory 入场券。vSphere 9.1、k0rdent、Rafay、OpenNebula 均在 2026 进入 NVIDIA-Certified Hypervisors;GB200 NVL72 仍以透传/拓扑保真为主,不是传统 vGPU 切片。
- 企业第一波生产 AI 是 7B–32B + embedding,不是 NVL72。Nutanix NAI 2.8 把 <8B 微调做成 GA、>100B 多节点仍是技术预览(厂商自称)。产品应先做“分支 GPU / MIG / 国产卡上的模型即服务”。
- MCP 网关与 Agent 身份是新的平台层。AgentMinder(2026-08-31 GA)、Nutanix Agent Gateway MCP GA、OpenShift MCP Gateway 技术预览、ZStack Zentrix,证明治理不能只做模型目录。
- 存储瓶颈从容量变成 KV Cache / 向量 / checkpoint / 对象。MLPerf Storage v3.0 已把这四类测进去;Gartner 称 2029 年前 70% 组织将部署专用 AI 存储层(其预测,非 TAM)。HCI 需要声明:哪些跑在分布式块上、哪些必须外置。
- 内存、NAND、光模块、液冷、电力是 2026–2028 的硬约束。传统服务器与 HCI 扩容被同一条供应链卡住;规划要以“降内存密度、KV 卸载、小模型、边缘侧推理”对冲,而不是按历史节点单价外推。
本目录不覆盖
厂商竞争档案、客户名单、内部路线图——那些不在本 industry 卷宗范围。本目录只回答产业场景与对我方产品规划的含义。
2026-09-03
产业日报 2026-09-03
来源范围:/workspace/hci-intel/archive/2026-09-03/industry/*.txt 高信号页。摘录保持原文,长度约 150–400 字。分析口径见各站立卷宗。
摘要
今日产业信号可以收成五句话:
- VMware 替代仍在加速,但存储与许可地板决定能不能迁完。 Gartner 把 hypervisor 换平台写成企业存储采购的位移窗口;Virtified 调查约一半用户计划到 2028 减量;Western Union、Everland 等案例继续流向 Nutanix。
- AI 私有云从“能跑模型”升级到“认证机架 + Agent 治理”。 VMware Explore 发 Private AI Cloud / AI Factory;Nutanix NAI 2.8 把 MCP 网关 GA;Cisco 把 Secure AI Factory 扩到 Supermicro 液冷机架。
- 数据面标准已换成 AI IO。 MLPerf Storage v3.0 加入 S3、KV Cache、向量库、大参数 checkpoint;Qdrant 把评测集推到 100 亿向量;MinIO 进入沙特 HUMAIN 主权 AI 数据层。
- Agent 同时推高升级周期与安全榜。 Google 称 83% 组织要升级才能跑生产 Agent;CSA 2026 威胁榜让 IAM 与两项 AI 威胁占据前排。
- 供给约束从 GPU 蔓延到内存、传统服务器与 HCI 交期。 Dell AI 与传统服务器同时暴涨;Nutanix 把硬件涨价和交期写进 FY27 保守指引。
对规划的即时含义:本周对外话术应同时带 dHCI/外置存储、MCP 网关、认证 Hypervisor、2 节点边缘 四件套,而不是只讲 VMware 迁移工具。
原文摘录
1. Gartner:Hypervisor 换平台正在重塑企业存储
- 归档:
gartner-hypervisor-replatforming-is-reshaping-enterprise-storage-f6bdc5b4.txt - URL:https://virtualizationreview.com/articles/2026/08/27/gartner-hypervisor-replatforming-is-reshaping-enterprise-storage.aspx
- 映射:
dhci.mddata-domain.md
The Aug. 19 2026 Magic Quadrant for Enterprise Storage Platforms says widespread licensing restructuring and pricing changes are prompting organizations to reconsider hypervisor strategies, creating what Gartner calls a "major displacement window." That transition is changing storage buying decisions along with virtualization decisions.
2. 约一半 VMware 用户计划到 2028 减量
- 归档:
half-of-vmware-users-plan-to-reduce-usage-by-2028-cb33bd28.txt - URL:https://www.theregister.com/software/2026/03/24/half-of-vmware-users-plan-to-reduce-usage-by-2028/5229588
- 映射:
index.mdedge.md
Half of VMware users plan to reduce their use of the virtualization pioneer’s products by 2028, according to a survey by independent analyst firm Virtified. Virtified principal Michael Warrilow told The Register VMware users are uncomfortable with Broadcom’s strategy of only selling a complete private cloud bundle – Cloud Foundation 9 (VCF 9).
3. VMware 推出 Private AI Cloud / AI Factory
- 归档:
vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-pre-24f6b7e2.txt - URL:https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559
- 映射:
large-models.mdagent-ready.md
He pointed to the results in VMware’s June survey of 1,800 IT decision-makers, with 56 percent saying that their organizations are running or planning to run production inference in a private cloud. Sixty-two percent are concerned about costs and 51 percent said they’re repatriating AI workloads due to security concerns.
4. Nutanix 扩展平台做生产级 Agentic AI(MCP 网关 GA)
- 归档:
nutanix-expands-cloud-platform-for-production-agentic-ai-660eff4d.txt - URL:https://virtualizationreview.com/articles/2026/08/26/nutanix-expands-cloud-platform-for-production-agentic-ai.aspx
- 映射:
agent-ready.mdsmall-models.md
One of the main additions in Nutanix Enterprise AI 2.8 is generally available MCP server management in Nutanix Agent Gateway. Agent Gateway serves as a centralized connection point between AI agents and MCP servers. Nutanix lists fine-tuning for models with fewer than 8 billion parameters and NVIDIA NIM microservices in air-gapped environments.
5. Cisco 自研 hypervisor 作为通话应用的 VMware 替代
- 归档:
cisco-set-to-release-home-brew-hypervisor-as-a-vmware-alternative-395bfd9a.txt - URL:https://www.theregister.com/software/2026/02/16/cisco-set-to-release-hypervisor-as-vmware-alternative/4965162
- 映射:
edge.mdruntime.md
Cisco is getting close to releasing its own hypervisor, as an alternative to VMware for users of its calling applications. Under Broadcom’s ownership, the virtualization giant is now reluctant to sell its low-end vSphere suites and instead focuses on its Cloud Foundation (VCF) private cloud bundle. The new hypervisor, NFVIS-for-UC, only supports Cisco’s calling applications.
6. Cisco Secure AI Factory 扩到 Supermicro 机架规模
- 归档:
cisco-secure-ai-factory-with-nvidia-expands-to-supermicro-rack-scale-s-8eca899a.txt - URL:https://www.servethehome.com/cisco-secure-ai-factory-with-nvidia-expands-to-supermicro-rack-scale-systems/
- 映射:
large-models.mdai-chain.md
Cisco this week announced that its Secure AI Factory with NVIDIA is expanding to rack-scale infrastructure built around Supermicro liquid-cooled and air-cooled systems. NVIDIA Cloud Partner Reference Architecture compliance anchors the design. Cisco says it will begin offering the Supermicro systems in October through its enterprise sales and channel ecosystem.
7. Google:Agentic AI 把企业基础设施推进升级周期
- 归档:
agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-go-6af11bcd.txt - URL:https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says
- 映射:
agent-ready.mdsmall-models.mdedge.md
Google Cloud's latest infrastructure research says enterprises are encountering a sizable infrastructure gap as agentic AI systems move from experiments and pilots into production. According to the report, 83% of surveyed organizations believe their current infrastructure requires some level of upgrade to support production-grade agentic AI systems.
8. MLPerf Storage v3.0:S3、KV Cache、向量库
- 归档:
mlperf-storage-benchmark-updated-for-modern-ai-47d4d4f8.txt - URL:https://www.blocksandfiles.com/ai-ml/2026/09/01/mlperf-storage-benchmark-updated-for-modern-ai/5293617
- 映射:
data-domain.md
V3.0 of the MLPerf Storage benchmark adds an S3 data layer to the existing POSIX one, plus KV Cache and vector database workload tests. Curtis Anderson said: “As the scale of AI contexts reaches into the trillions, we expect object-based storage systems to emerge as a viable – and possibly preferred – alternative to filesystem-based storage.”
9. Qdrant 把向量评测集放大 1000 倍
- 归档:
it-ain-t-big-enough-qdrant-uprates-vector-benchmark-dataset-size-1-000-c56ffea3.txt - URL:https://www.blocksandfiles.com/ai-ml/2026/09/01/it-aint-big-enough-qdrant-uprates-vector-benchmark-dataset-size-1000x/5293826
- 映射:
small-models.mddata-domain.md
Qdrant has produced a 10 billion record dataset for vector retrieval benchmarking, because existing datasets are too small. Qdrant says “FineWeb-10B is the largest open-source vector database benchmark that we know of. It holds 24.47 TB of vectors and 28.66 TB of source text and metadata.”
10. MinIO 为沙特 HUMAIN 建 AI 数据织物
- 归档:
minio-goes-to-saudi-arabia-to-build-humain-ai-data-fabric-5f549cdc.txt - URL:https://www.blocksandfiles.com/object/2026/09/01/minio-goes-to-saudi-arabia-to-build-humain-ai-data-fabric/5293687
- 映射:
data-domain.mdai-chain.md
MinIO is partnering Saudi Arabia's sovereign wealth fund to provide the data foundation for a sovereign Saudi AI Stack provided by HUMAIN. MinIO and HUMAIN assert that the future of AI will not be defined by individual models or isolated applications. It will be built with integrated platforms that unify infrastructure, compute, data, memory, models, agents, and intelligent applications.
11. Dell:AI 工作负载带动营收,传统服务器一并暴涨
- 归档:
dell-s-revenue-bonanza-benefits-from-killer-ai-workloads-51bd990a.txt - URL:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866
- 映射:
large-models.mdai-chain.mdhardware.md
Revenues of $47 billion in the quarter ended July 31, beat its $45 billion high-end outlook, and were 58 percent higher than a year ago. Jeff Clarke said customers invested accordingly: “That’s clearest in our AI server business where we booked a record $60.9 billion in orders, recognized a record $16.4 billion in revenue and exited the quarter with a record $95 billion backlog.”
12. CSA 2026 云威胁榜:身份与 AI 居前
- 归档:
identity-ai-lead-csa-s-2026-cloud-threat-list-057ca2b2.txt - URL:https://virtualizationreview.com/articles/2026/08/24/identity-ai-lead-csas-2026-cloud-threat-list.aspx
- 映射:
agent-ready.md
Identity and access management has overtaken misconfiguration as the top cloud security concern in the Cloud Security Alliance's 2026 ranking, while two artificial intelligence-related issues entered the list for the first time. The CSA Top Threats Working Group surveyed 507 security professionals, producing a Top 11 led by identity, AI, third-party resources and APIs.
13. Western Union 从 VMware 迁到 Nutanix
- 归档:
western-union-zaps-vmware-and-moves-to-nutanix-1735855a.txt - URL:https://www.theregister.com/software/2026/04/08/western-union-zaps-vmware-and-moves-to-nutanix/5219797
- 映射:
index.md(替代案例,非份额)
Western Union has commenced a migration from VMware to Nutanix after deciding it didn’t want to do business with Broadcom. Brandon Shaw told the audience at Nutanix’s .NEXT conference that Western Union is six months into a migration of 900 to 1,200 applications that run across a 3,900-core server fleet.
14. NVIDIA 发起的 Open Secure AI Alliance 转入 Linux 基金会
- 归档:
nvidia-founded-open-secure-ai-alliance-moves-to-linux-foundation-eebd6de2.txt - URL:https://virtualizationreview.com/articles/2026/09/02/nvidia-founded-open-secure-ai-alliance-moves-to-linux-foundation.aspx
- 映射:
agent-ready.mdai-ready.md
The Open Secure AI Alliance, launched by NVIDIA in July to develop open security technologies for AI systems and agents, has moved under the Linux Foundation. The Linux Foundation announced the transition Sept. 2. The Alliance’s stack includes identity, governance, enforcement, containment and recovery, and a trusted foundation with hardware identity, isolation, protected keys and evidence.
15. Nutanix 仍增长,但把外置存储与硬件涨价写进叙事
- 归档:
nutanix-grows-despite-hardware-price-rises-9582df0d.txt - URL:https://www.blocksandfiles.com/hci/2026/08/27/nutanix-grows-despite-hardware-price-rises/5292962
- 映射:
dhci.mdai-chain.md
Revenues in the quarter ended July 31 were $757.1 million, 16 percent more than a year ago. CEO Rajiv Ramaswami said FY26 included new or enhanced agreements with AMD, Lenovo, NetApp and Nvidia, and “innovation across our cloud platform, especially with respect to AI and broadening our support for external storage.”
归档噪声(不入站立结论)
以下抓取页存在正文被站点导航污染或与规划无关,日报不展开:nutanix-brings-its-k8s-to-bare-metal-*、nutanix-to-add-kubevirt-*、aws-adds-nested-virtualization-*(txt 为侧栏;嵌套虚拟化事实已用 AWS 官方页写入 runtime.md)、xen-project-gets-serious-about-safety-*、笔记本评测与部分中文门户首页。
明日建议跟踪
- NVIDIA-Certified Hypervisors 官方名单是否新增国产/KVM 厂商。
- Nutanix–NetApp NFS 是否仍只 EA。
- VCF Edge 与 VxRail 双节点升 9.1 的路径有无补丁说明。
解聚 HCI(dHCI):NVMe/TCP、外置存储与 VMware 替代的存储夹击
日期:2026-09-03
场景定义
传统 HCI 把计算与存储锁在同一组节点上:扩 CPU 必须带盘,扩容量必须带核。解聚 HCI(dHCI / disaggregated HCI) 保留 HCI 的统一运维(VM 生命周期、快照、一键升级),但把主存储外置到阵列、存储集群或 NVMe-oF 目标,使计算与存储可按不同斜率扩。
2026 年这个场景不再是“HPE 一家的产品名”,而是四条并行路径:
- 阵列作 AHV/KVM 的外置 datastore(Nutanix + NetApp ONTAP NFS;Nutanix NVMe/TCP 对接外部阵列)。
- 软件定义存储集群给计算集群喂数(VMware vSAN Storage Clusters,前称 vSAN Max)。
- 服务器 + 阵列的厂商封装 dHCI(HPE Alletra dHCI:ProLiant + Alletra/Nimble,vCenter 内管理)。
- 从一体机 HCI 退回可组合私有云(Dell:VxRail 仍卖,但战略语言转向 Dell Private Cloud + PowerStore/PowerFlex + 多 hypervisor)。
协议选择是架构决策:NVMe/TCP 跑在以太网;FC / FC-NVMe 跑在独立 SAN;NFS 仍是“保住 NetApp 投资、换 hypervisor”的最低摩擦路径。
为何现在重要
- Hypervisor 换平台正在改存储采购。 Gartner 2026-08-19《Magic Quadrant for Enterprise Storage Platforms》把许可重构称为 “major displacement window”,并明确建议:不要买把数据绑死在单一 hypervisor 上的存储,优先 hypervisor-agnostic、容器互通、带自动 VM 转换工具的平台。点名的目标栈包括 OpenShift、Nutanix AHV、Azure Local、KubeVirt。出处
- VMware 用户在缩栈,但存储往往动不了。 Virtified 对 14 国 450 名 VMware 用户的调查:约一半计划到 2028 年减少 VMware 用量;障碍包括缺替代、不能上公有云、风险偏好低。存储绑定是“看起来能迁、实际迁不动”的主因。出处
- HCI 增长本身在减速,外置存储变成第二增长曲线。 Nutanix FY2026 营收 28.5 亿美元(+12% YoY),Q4 营收 7.571 亿美元;CEO 把“拓宽外置存储支持”与 AI 并列为本年平台创新。William Blair 分析师把 external storage 列为 newer product offerings 之一。以上为 Blocks & Files 对财报的转述,非独立 TAM。 出处
- AI 把存储瓶颈从容量改成数据路径。 同一篇 Gartner 分析称:加速计算的瓶颈正从 GPU 转向存储数据层;并预测到 2029 年 70% 组织将部署专用 AI 存储层(2026 年不到 10%)——这是分析师预测,不是已发生的份额。
对中国规划的含义:大量政企、制造、金融客户的 VMware 替代项目,第一约束不是 AHV/KVM 功能清单,而是 FC SAN / ONTAP / 备份软件认证能不能留下。
2025–2026 动态(已核验)
1. Nutanix 外置存储:从“HCI 原教旨”到 NFS + NVMe/TCP
NetApp ONTAP 作为 AHV 外置存储(NFS)
- 2026-04-07 .NEXT:Nutanix 与 NetApp 宣布战略合作,把 ONTAP 企业存储接到 NCP + AHV。厂商自称独立扩计算/存储、Prism 调用 ONTAP 数据服务(快照、勒索防护等)。Nutanix 新闻稿
- NetApp 官方博客:这是 首次 ONTAP 可作为 Nutanix 环境的外置存储;传输为 NFS API;Early Access 进行中,GA 目标 2026 Q3(厂商时间表,非已 GA)。后续还规划 NetApp 云存储服务对接 NCP、ONTAP 对接 Nutanix Kubernetes Platform。NetApp 博客
- heise 技术解读:连接基于 NFS,AHV VM 使用外部 datastore;这是对 Nutanix“计算存储永远同节点”模型的架构断裂。对已有 ONTAP 客户,换 vSphere→AHV 不必先换存储;NetApp Shift Toolkit + Nutanix Move 被厂商称为可把转换从小时级压到分钟级(厂商自称,需 POC)。heise
NVMe/TCP 对接外部阵列
- Nutanix 官方博客《Fibre Channel or NVMe over TCP?》把 NVMe/TCP 定义为“Nutanix + 外部阵列”的未来就绪路径,并点名与 Everpure 等阵列的合作;同时承认 FC 在近零丢包、独立 SAN 隔离场景仍有位置。厂商立场,不是基准测试。 Nutanix 博客
- 协议现实(2026):NVMe/TCP 用普通 25/100GbE,无需无损以太网;FC-NVMe 仍是银行/医疗/已有 Gen7/Gen8 光网络的默认。Dell 较早的运输层对比白皮书结论是:在 ESXi + PowerStore 上,NVMe/TCP 的每 IO 成本优于 FC,极致 IOPS/延迟仍看 NVMe/FC——该白皮书未给出 2026 新测,只能作方向参考。Dell PDF
2. vSAN Storage Clusters:VCF 把 HCI 解聚做成一等公民
- 官方设计文档:vSAN Storage Clusters(前称 vSAN Max)基于 ESA,给 vSphere 计算集群提供解聚主存储,也可给传统 vSAN HCI 集群补容量。计算集群可挂远程 datastore;当前只有 ESA 的 vSAN HCI 能挂 Storage Cluster datastore。必须用认证 ESA ReadyNode;不支持原地把 HCI 集群转成 Storage Cluster。VMware 文档
- VCF 9.x 设计库:Storage Cluster 引入“去收敛存储网络”——内部复制/再平衡流量与 client 集群 IO 分 VLAN;最小 3 节点全贡献存储。Broadcom TechDocs
- VCF 9.1 社区解读(需当二手):Storage Cluster 可跨 vCenter、甚至跨独立 VCF 实例挂载;支持 OSA+ESA 混挂。对传统本地 vSAN 用户几乎无感,对已经解聚的人是 9.1 最重要的存储变化。ProVirtualzone
规划含义:VCF 9 不是“强制 HCI”,而是 HCI 与解聚存储双轨。替代产品如果只会卖三节点全闪 HCI,会在“已有 vSAN Max / 已有阵列”的大客户上直接出局。
3. HPE Alletra dHCI:仍活着,但 hypervisor 绑定是风险
- HPE 产品页仍在卖 Alletra Disaggregated HCI:ProLiant + Alletra 阵列,计算/存储独立扩,vCenter 内 VM 中心运维,GreenLake / Private Cloud Business Edition 自动化。厂商自称 15 分钟上线、100% 数据可用、亚毫秒延迟——未独立验证。HPE
- QuickSpecs 2026-02-02 仍更新(Version 18,HPE 品牌重命名),存储侧仍列 Alletra 6000/5000 或 Nimble。HPE QuickSpecs
- 缺口:该栈的虚拟化控制面仍是 vSphere。VMware 替代浪潮下,HPE 并行推 Morpheus VM Essentials(KVM,可同时管 VMware 与 HVM)。Alletra dHCI 本身不是 hypervisor 替代品。PeerSpot 2026 用户评论已出现“客户因 VMware 许可跳过 HPE HCI”的表述,属用户评价,不是市场份额。
4. Dell VxRail:不是 EOL,但是战略后撤
必须把“撤退”说准确,避免把传言写成事实:
- 不是停售。 独立顾问 C4C Group(2026 年中):Dell 仍在卖 VxRail,仍发布 8.x / 9.x 支持矩阵;2026-06 Dell 与 VMware 公布从 VxRail 原地升到 VCF 9.1 的支持路径(要求 VxRail ≥ 8.0.361 等)。拉伸集群、dynamic nodes、双节点、satellite 节点 尚无 到 9.1 的支持路径。C4C
- 战略语言已变。 CRN 报道 Michael Dell 称 “VxRail is no longer a thing”;Dell 转向 Dell Private Cloud,可搭配 Nutanix AHV、Hyper-V、Red Hat 或 VMware,存储落到 PowerStore / PowerFlex,用 Dell Automation Platform 迁出。Dell 发言人同时声明 没有停止销售或支持 VxRail 的计划。CRN 2025
- 旧款机型按代次 EOL(如 14G 硬件支持到 2027-09-30)≠ 产品线停售。hardwarewartung 生命周期表
- 2026-09 Dell 财报叙事已是 AI 服务器与解聚架构,不是 HCI 一体机:COO Clarke 称 “AI requires modern, disaggregated architectures that keep data accessible and in motion across compute, storage, and networking”。Blocks & Files
结论:VxRail 的“撤退”是 渠道激励与故事主线从 VMware 一体机转向多 hypervisor 解聚私有云,不是产品死亡。替代窗口存在于:许可痛、双节点/拉伸升 9.1 无路径、伙伴被激励迁到 Private Cloud。
5. NVMe/TCP vs FC:2026 的分工而不是替代战争
| 维度 | NVMe/TCP | FC / FC-NVMe |
|---|---|---|
| 网络 | 标准以太网 | 独立光纤 SAN |
| 技能 | IP/以太网团队 | SAN zoning 团队 |
| 典型买家 | 换 hypervisor、云化、Nutanix/KVM + 外置阵列 | 已有 32/64GFC、核心库延迟 SLO |
| 2026 角色 | 新部署与 dHCI 默认候选 | 存量核心交易系统继续 |
Nutanix 明确把 NVMe/TCP 写成外置阵列的主推协议,同时留下 FC 给“近零丢包”。产品规划不能赌“FC 已死”:中国金融客户的存储团队仍以 FC 证书与多路径软件为验收项。正确姿势是 块协议双栈:iSCSI/NVMe/TCP 做新,FC 做共存与双活。
谁在卖什么
| 厂商 | 产品 | 形态 | 2026 要点 | 标签 |
|---|---|---|---|---|
| Nutanix | NCP / AHV + 外置存储 | HCI 软件 + NFS/NVMe/TCP 阵列 | NetApp ONTAP EA,GA 目标 2026 Q3;CEO 把 external storage 列为 FY26 创新 | 厂商路线图 |
| NetApp | ONTAP + Shift Toolkit | 阵列 OS + VM 转换 | 第一次成为 Nutanix 外置存储;NFS | 厂商自称 |
| Broadcom / VMware | vSAN Storage Clusters + VCF 9.1 | 解聚 SDS | ESA、跨 vCenter 挂载(9.1)、去收敛网络 | 官方文档 |
| HPE | Alletra dHCI;Morpheus VM Essentials | 服务器+阵列;KVM 管理 | dHCI 仍绑 vSphere;HVM 是真正的 hypervisor 替代 | 产品页 |
| Dell | VxRail;Dell Private Cloud + PowerStore/PowerFlex | 一体机 HCI vs 解聚 | VxRail 仍售;战略与激励转向多 hypervisor | CRN + Dell 声明 |
| 阵列侧(NVMe/TCP 生态) | Everpure 等(Nutanix 点名) | NVMe/TCP 目标 | 用于“阵列留下、计算换成 AHV” | 厂商点名,未做份额 |
国内对照(规划用,不作份额断言):SmartX 榫卯仍以分布式块为主,同时做三层双活方案(其博客《基于超融合的三层双活》);ZStack 区分 Cube HCI 与 Cloud/SDS。对中国买方,“dHCI”常被说成“超融合 + 集中式存储双活”,与国际 dHCI 产品名不完全等同,POC 时要问清协议(NFS/FC/NVMe/TCP)和管理面(是否一个控制台)。
客户要什么 vs 缺口
要什么
- 换 ESXi 但不做存储 forklift。
- 计算按核扩、存储按 TiB 扩,避免 HCI 过配。
- 快照、复制、勒索防护、备份软件认证不丢。
- 迁移工具能读现有 VMFS/NFS/vVol,而不是先灌到新分布式存储。
- 核心库继续 FC 或低延迟块;AI/备份/对象走以太网。
缺口(2026-09 仍在)
- Nutanix+NetApp 尚未 GA(目标 Q3)。把它写进 2026 上半年交付的替代标书有进度风险。
- NVMe/TCP 在国产阵列、国产网卡、国产交换机上的互操作矩阵公开材料少,不能假设“有以太网就能上”。
- HPE Alletra dHCI 不能单独解决 VMware 许可问题。
- VxRail 客户升 VCF 9.1 时,双节点/拉伸/satellite 仍被排除。
- 多数国产 HCI 的“外置存储”仍是 iSCSI/FC 挂卷给 VM,而不是把阵列数据服务编进 hypervisor 控制面(快照、QoS、恢复在 Prism/vCenter 一等公民)。Gartner 要的正是后一种。
对我方产品规划的可执行含义
- 把 dHCI 写成正式 SKU 与参考架构,而不是“高级配置”。 三条交付件:① AHV/KVM 集群 + 外置 NFS;② 同集群 + NVMe/TCP 块;③ 计算集群挂本产品自研存储集群(对标 vSAN Storage Clusters)。缺任何一条,都会在对应招标里被 NetApp/VCF/HPE 组合打掉。
- 迁移故事按存储不动来写。 工具链优先级:无代理 V2V(换计算) > 存储在线转换 > 最后才是“迁到我们的分布式存储”。NetApp Shift + Nutanix Move 的组合是当前对标。
- 协议:NVMe/TCP 做新项目默认,FC 做认证清单而不是路线图弃子。 金融 POC 必须带多路径、超时、故障切换;不要用实验室 iSCSI 数字代替。
- 不要把 Dell VxRail 写成“已死”。 话术应是:一体机 HCI 不再是 Dell 的增长叙事;多 hypervisor + PowerStore/PowerFlex 才是。我方应抢的是 被激励迁出 VxRail、但还不想上 VCF 9 全栈 的客户。
- 存储控制面 API 比多一个数据服务更重要。 快照/克隆/QoS/恢复要能被虚拟化管理员在同一 UI 调用,否则仍是“HCI + 旁边一台阵列”,过不了 Gartner 2026 的联合评估框架。
- AI 存储层不要硬塞进 HCI 节点。 KV Cache、checkpoint、向量热数据应允许外置(见
data-domain.md)。dHCI 的战略价值之一就是让 GPU 节点不背 HDD。
出处
- Gartner 存储 MQ 与 hypervisor replatforming:https://virtualizationreview.com/articles/2026/08/27/gartner-hypervisor-replatforming-is-reshaping-enterprise-storage.aspx
- Virtified / VMware 减量调查:https://www.theregister.com/software/2026/03/24/half-of-vmware-users-plan-to-reduce-usage-by-2028/5229588
- Nutanix FY26 与外置存储:https://www.blocksandfiles.com/hci/2026/08/27/nutanix-grows-despite-hardware-price-rises/5292962
- Nutanix–NetApp 新闻稿:https://www.nutanix.com/press-releases/2026/nutanix-and-netapp-form-strategic-alliance
- NetApp 博客(EA / GA Q3 2026):https://www.netapp.com/blog/modernize-virtualization-nutanix-partnership/
- heise 解读 NFS 解聚:https://www.heise.de/en/news/Nutanix-Partnerships-with-NetApp-and-Cisco-lower-VMware-migration-hurdle-11249671.html
- Nutanix NVMe/TCP vs FC:https://www.nutanix.com/blog/fibre-channel-or-nvme-over-tcp
- vSAN Storage Clusters 设计:https://www.vmware.com/docs/vmw-vsan-storage-clusters-design-and-operations
- VCF 9 Storage Cluster 模型:https://techdocs.broadcom.com/us/en/vmware-cis/vcf/vcf-9-0-and-later/9-0/design/design-library/storage-models-9-x/standard-vsan-storage-model/single-rack-storage-models/vsan-storage-cluster-storage-model.html
- HPE Alletra dHCI:https://www.hpe.com/us/en/storage/alletra-dhci.html
- CRN / Michael Dell on VxRail:https://www.crn.com/news/data-center/2025/michael-dell-says-vxrail-is-no-longer-a-thing-as-company-boosts-dell-private-cloud-partner-incentives
- C4C VxRail 2026 状态:https://www.c4cgroup.co.uk/guides/vxrail-broadcom-eol-options/
- Dell 2026 Q2 财报转述:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866
小模型(7B–32B):蒸馏、Embedding 与分支 GPU
日期:2026-09-03
场景定义
本卷宗的“小模型”不是科研玩具,而是企业私有云上 可单卡或小集群生产服役 的模型档:
- 7B–14B:默认生产学生模型;适合分类、摘要、工单、内部 Copilot、工具调用。
- 14B–32B:推理/复杂 RAG 的“单机甜区”;4bit 量化后可进 24–48GB 卡。
- 蒸馏(distill):用前沿教师模型生成任务数据,微调小学生模型,换 Token 成本与数据不出域。
- Embedding / 重排:768–1536 维向量,RAG 的刚需,CPU 或小 GPU 即可,但存储与 QPS 敏感。
- 分支 GPU:数据中心边缘、工厂、门店、地市节点上的 1–4 卡,不是 NVL72。
与大模型卷宗的边界:训练 70B+、多机并行、GB200 NVL72、AI Factory 见 large-models.md。本卷宗回答 VMware 替代完成后,第一波可售的 AI 能力是什么。
为何现在重要
- 生产推理在回流私有云。 Broadcom 在 VMware Explore 2026 引用其 6 月对 1800 名 IT 决策者的调查(厂商调查):56% 已在或计划在私有云跑生产推理;62% 担心成本;51% 因安全把 AI 工作负载迁回;公有云用于此类负载同比降 15 个百分点到 41%。Next Platform
- Agent 让 Token 变成非线性。 Google Cloud《2026 State of infrastructure in the agentic AI era》:83% 受访组织认为现有基础设施需要某种升级才能支撑生产级 Agent;一次 Agent 提示可触发数百下游动作。小模型是把这些动作留在内网、可控成本的手段。Virtualization Review
- HCI 厂商已把 <8B 写成 GA,>100B 仍预览。 Nutanix Enterprise AI 2.8(2026-08-26 GA):Private Inference 支持 <80 亿参数微调;>1000 亿参数的多节点/多 GPU 推理仍是 技术预览,厂商明确禁止生产使用;KV Cache 从 GPU 卸到 CPU 内存也是预览。Virtualization Review / Nutanix
- 边缘明确需要本地 SLM。 同份 Google 报告:90% 认为在边缘部署生成式模型重要。NVIDIA 用新 Orin Nano 2(H1 2027 上市)加厚入门边缘 AI,说明分支侧不是被放弃的市场。STH
对中国规划:信创机房很难拿到 NVL72 配额,但 7B–32B + 国产卡/MIG 是可以交付的。VMware 替代项目若只交“能跑 VM”,会在第二年被“模型服务平台”标书分流。
2025–2026 动态
蒸馏成为企业默认降本手法
公开技术讨论(2026 中)把生产蒸馏的学生模型默认放在 7B–14B:Qwen 3 8B 常被当作默认学生(单 A10/L4);Gemma 4 12B 用作推理更重的任务;32B 蒸馏(如 DeepSeek-R1-Distill-Qwen-32B)在 4bit 后约 20GB,可进单张 L40/A100。这些是模型卡与工程博客的硬件经验,不是基准排名,POC 必须用自己的任务集复测。
参考:
- 生产蒸馏流程概述:https://aitechconnect.in/tips/llm-distillation-teacher-student-production-2026
- R1 蒸馏档位与显存经验:https://willitrunai.com/blog/deepseek-r1-vram-requirements-guide
- 32B GPTQ 4bit ~20GB、单 L40:https://huggingface.co/empirischtech/DeepSeek-R1-Distill-Qwen-32B-gptq-4bit
VMware AI Factory 厂商自称 已可运行 150+ 开源/商用模型,并加入 Nemotron 3、Gemma 4、Qwen 3.7-Max、GLM 5.2 等——说明目录战的入场券是“开源权重 + 国产/开源家族”,不是只绑一个闭源 API。Next Platform
Embedding 把 HCI 变成向量存储问题
Qdrant 2026-09-01 发布 FineWeb-10B:100 亿文档、24.47 TB 向量、28.66 TB 原文与元数据(厂商数据集声明)。结论不是“每家都要 100 亿向量”,而是:评测集已经大到让“内存里放得下”的假设破产,磁盘路径、压缩、召回@k 必须进产品能力。Blocks & Files
SmartX 在榫卯超融合上测 Qdrant v1.18.2(Cohere 1M/10M × 768 维):厂商自称 性能达到或超过 QdrantCloud 官方基准;16GB 内存 + 向量压缩 + rescore,可承载约 31GB 工作集的千万级向量,570+ QPS、0.93+ 召回。这是厂商实验,硬件为 Xeon Gold 5218R + NVMe 缓存 + HDD,不能外推为通用 SLA。但它证明:中型 HCI 全闪/分层集群 可以 把 embedding 检索当生产负载,而不是必须外置专用向量一体机。SmartX 博客(抓取页:hci-intel/archive/2026-09-03/smartx/ai实践-超融合支持qdrant向量数据库的性能验证与调优实践-b200e2b7.txt)
MLPerf Storage v3.0 把向量库(Milvus,100 万向量 × 1536 维)列为正式负载,与训练、checkpoint、KV Cache 并列。说明标准组织已把 embedding 检索当成存储产品必须回答的问题。Blocks & Files
分支 GPU:小模型的物理落点
- 数据中心“分支”:1–8 张 L40S/L4/国产推理卡,与业务 VM 同集群或独立小集群。Nutanix 把 fine-tune <8B 放在现有 NCP 上,明确“不要为 AI 重建业务系统”(Cornely,厂商表态)。
- 站点边缘:Jetson Orin Nano 2,厂商称较上代 Nano 实得性能约 2× 或同性能降耗约 40%,H1 2027 出货。面向机器人、无人机、视觉,不是机房 GPU。
- 中国分支:昇腾推理卡、寒武纪 MLU、海光 DCU 更常出现在“行业小模型 + 信创主机”标书,而不是 NVL72(见
hardware.md)。
Token 成本优化也在小模型路径上出现:Jedify 等上下文图工具宣称可降 75% Token(厂商自称,2026-08-27),说明应用层会继续压缩提示,基础设施侧不能只按“上下文越长越好”规划显存。Blocks & Files
谁在卖什么
| 厂商 | 产品 | 小模型相关能力 | 备注 |
|---|---|---|---|
| Nutanix | Enterprise AI 2.8 / Agent Gateway / Private Inference | <8B 微调 GA;NIM 断网部署;MCP 治理;>100B 多节点预览 | 双原生,强调不重建业务系统 |
| Broadcom VMware | Private AI Cloud / AI Factory / Tanzu | 150+ 模型目录(厂商自称);SLM+LLM;租户隔离 nameplate;安全沙箱 | 绑 VCF 9 |
| Red Hat | OpenShift AI + vLLM / llm-d | 分布式推理;MCP Catalog 开发者预览 | AgentOps 框架,见 agent-ready |
| SmartX | 榫卯 AI 平台 + SMTX OS | 算力/模型/网关;Qdrant 同集群验证(厂商实验) | 路径:先云底座再模型再 Agent |
| ZStack | Zentrix | 统一模型接入、Token 账、Agent 调用拦截 | 从分散 API Key 到治理 |
| NVIDIA | NIM、NVAIE、Jetson | 小模型微服务 + 边缘模组 | 认证矩阵决定谁能卖“AI ready” |
| 开源权重 | Qwen / Gemma / DeepSeek 蒸馏 / Nemotron | 7B–32B 学生模型 | 目录必须可更新,不要写死版本 |
客户要什么 vs 缺口
要什么
- 数据不出域的内部问答、代码助手、单据抽取。
- 按部门/租户的模型目录与 API Key,而不是每人一张公有云 Key。
- 单卡就能上线,不要先批一个 AI 机房。
- Embedding 与业务文件同机房,延迟稳定。
- 国产卡或 MIG 切片,避免一张 H100 被一个试点占死。
缺口
- 多数 HCI 只有“GPU 透传给一台 VM”,没有模型网关、量化策略、KV 卸载、多 LoRA。
- 向量库与超融合的 NUMA、RDMA、副本策略缺乏官方支持矩阵(SmartX 是少数公开测过的,仍是厂商实验)。
- 蒸馏流水线(教师调用、数据过滤、学生训练、回归评测)没有产品化,停留在数据团队笔记本。
- 分支站点缺 2 节点 + 1 张推理卡的参考架构(与
edge.md交界)。
对我方产品规划的可执行含义
- 把“模型即服务(7B–32B)”做成 VMware 替代标书的标准可选包,不要等大模型项目。最小集:vLLM/NIM 等价 serving、量化(AWQ/GPTQ/INT8)、租户 Token 配额、审计日志。
- 官方支持三种 GPU 切片:整卡透传(32B)、MIG/vGPU(7B–14B 多租户)、CPU/NPU embedding。Nutanix 把 >100B 标成预览是正确的产品诚实:先把能 GA 的做硬。
- Embedding 作为存储场景进 HCI 性能验收,不要只跑 FIO。至少覆盖:768 维千万向量、磁盘优先 + 压缩、召回与 P95。对标 Qdrant/Milvus,而不是“AI 就绪”口号。
- 蒸馏不是训练集群需求。 规划文档写清:教师可在公有云或隔离区,学生在生产 HCI 上 QLoRA;避免把小模型项目做成千卡采购。
- 分支 SKU:2–3 节点 HCI + 1 张 24–48GB 卡 + 本地向量盘,作为地市/工厂标准件。与 NVL72 方案分目录报价。
- 模型目录中立。 必须同时列 Qwen、Gemma、DeepSeek 蒸馏、国产卡可用的对应权重;VMware 已经在目录里加 Qwen 与 GLM,国内招标会逐项对表。
出处
- VMware Private AI Cloud / 调查数字:https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559
- Google agentic 基础设施报告:https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says
- Nutanix NAI 2.8:https://virtualizationreview.com/articles/2026/08/26/nutanix-expands-cloud-platform-for-production-agentic-ai.aspx
- Nutanix 新闻稿:https://www.nutanix.com/press-releases/2026/nutanix-gives-enterprises-the-freedom-to-run-production-agentic-ai-their-way
- Qdrant 10B:https://www.blocksandfiles.com/ai-ml/2026/09/01/it-aint-big-enough-qdrant-uprates-vector-benchmark-dataset-size-1000x/5293826
- MLPerf Storage v3.0:https://www.blocksandfiles.com/ai-ml/2026/09/01/mlperf-storage-benchmark-updated-for-modern-ai/5293617
- Jetson Orin Nano 2:https://www.servethehome.com/nvidia-announces-jetson-orin-nano-2-entry-level-edge-board-gets-new-ampere-silicon/
- SmartX Qdrant 实验:本地抓取
hci-intel/archive/2026-09-03/smartx/ai实践-超融合支持qdrant向量数据库的性能验证与调优实践-b200e2b7.txt
大模型与 AI Factory:GB200/NVL72、认证 Hypervisor 与平台争夺
日期:2026-09-03
场景定义
“大模型”在本卷宗指需要 多 GPU 规模互连、机架级铜互连、专用存储与电力 的生产负载:
- 70B+ 密集模型或千亿/万亿 MoE 的训练、持续预训练、长上下文推理。
- AI Factory:NVIDIA 提出、Omdia/OEM 沿用的说法——以 Token 生产为中心的超高资本密度机房,而不是传统虚拟化集群上插几张卡。
- 认证 Hypervisor:NVIDIA-Certified Hypervisors 项目,用计算/内存/数据路径/LLM 推理一组负载对比裸金属与纯 KVM 基线,验证“虚拟化后仍接近裸金属”。
与小模型卷宗的分工:单卡 7B–32B、embedding、分支推理见 small-models.md。本卷宗是 GPU 机柜 + 多租户 IaaS + 私有 AI 云。
为何现在重要
- 资本与叙事已经离开传统机房。 Next Platform 转述 Omdia:全球数据中心投资到 2030 年将接近 1.6 万亿美元;“今年”科技企业 AI 基础设施支出超过 6000 亿美元——这是分析师预测/转述,不是我方测算。Next Platform 2026-09-01
- Dell 把企业 Agent 写成 2028 最大负载。 截至 2026-07-31 季度:营收 470 亿美元;AI 优化服务器收入 164 亿美元;订单 609 亿美元;积压 950 亿美元(均为 Dell 财报数字,经 Blocks & Files 转述)。Clarke:厂商观点 “enterprise agentic is expected to be the single largest workload by 2028”。Blocks & Files
- 虚拟化重新被允许进入 AI Factory,前提是认证。 2026 年 NVIDIA 正式推出 Certified Hypervisors;vSphere 9.1、Mirantis k0rdent、Rafay、OpenNebula 均宣布通过 GB200 NVL72 或 HGX/NVL72 轨道。没有认证,neocloud / 主权云招标会把软件层直接写成 NVIDIA 参考架构 + 裸金属。
- VMware 用 Private AI Cloud 把“留下 VCF”绑定到 AI。 Explore 2026:VCF 9 之上叠 Private AI Cloud 与 AI Factory(model-as-a-service),MetalSoft 编排从金属到模型。这是 Broadcom 对“一半用户计划减量”的高端对冲。
2025–2026 动态
VMware Private AI Cloud / AI Factory
- 发布场合:VMware Explore 2026 拉斯维加斯。基础是 VCF 9;ReadyNode 来自 Dell、Cisco、Lenovo、Supermicro 等;加速器含 NVIDIA 与 AMD Instinct MI350 + ROCm。厂商自称 NVMe memory tiering 可降每主机成本至多 42%。Next Platform
- vSphere 9.1 成为 NVIDIA-Certified Hypervisor,覆盖 Blackwell 与 Hopper;测试类别含 GPU 集合通信、带宽、计算、推理、RDMA、拓扑映射。VCF 博客(抓取:
vmware-cloud-foundation-achieves-nvidia-certification-ai-workloads-val-89712ca8.txt) - 安全与 Agent:AI Gateway、安全沙箱、TrueSource、vDefend、Avi;Tanzu 作为 Agent 层,deny-by-default 沙箱。AgentMinder 同周 GA(见
agent-ready.md)。
Cisco Secure AI Factory:机架规模外包给 Supermicro
Cisco 把 Secure AI Factory with NVIDIA 扩到 Supermicro 液冷/风冷机架,宣称符合 NVIDIA Cloud Partner 参考架构;前端 Cisco Silicon One N9300,后端 N9100 + Spectrum-X;映射 NVL72(Vera Rubin / Grace Blackwell)、HGX NVL8(Rubin / B300)、MGX PCIe。企业架构 <~1000 GPU,云架构 1000–100000+ GPU。厂商计划 2026-10 通过 Cisco 渠道开卖,物理维修仍由 Supermicro 做。Cloud Control 统一管理目标日历 2026 Q4。STH
含义:网络巨头承认自研 UCS 迭代跟不上 GPU 代际,HCI/虚拟化软件若还按“三年认证一台四路服务器”会错过整机柜窗口。
认证 Hypervisor 三家挑战者(2026 夏)
Mirantis k0rdent AI
- 首批 NVIDIA-Certified Hypervisors,GB200 NVL72 + Grace CPU 轨道;此前已是 NVIDIA AI Cloud Ready ISV。
- 强调机架级拓扑:NVLink scale-up + Quantum IB / Spectrum-X scale-out,NUMA/GPU 亲和。
- VMaaS 为 技术预览;同时卖 BMaaS 与 K8s。虚拟化卖点是租户隔离与分钟级回收 vs 物理机 15–20 分钟重启。Mirantis
Rafay
- 2026-08-27:Rafay VMaaS 通过认证,覆盖 HGX 与 NVL72。定位是 GPU PaaS / Token Factory,把裸金属、VM、K8s、Slurm、推理服务做成可计量的多租户消费层。Rafay(抓取
rafay-achieves-nvidia-certified-hypervisors-status)
OpenNebula
- OpenNebula 7.2 完成 GB200 NVL72 ARM 轨道认证:PCI 透传 + 虚拟机内跑 OneKS(Elastic Kubernetes)。路线是“虚拟化工作环境,但不虚拟化加速器数据路径”。OpenNebula
NVIDIA AI Enterprise 支持矩阵仍写明:GB200 NVL4/NVL72、GB300 NVL72 不要求 NVIDIA-Certified Systems,而要求 Qualified server;DGX GB200 NVL72 在部分表中仍标 bare metal only。认证 Hypervisor 与“整机认证”是两张表,写标书时不能混。NVAIE 8.1 Support Matrix
OpenShift AI
Red Hat 把 OpenShift + OpenShift AI 写成企业 Agent 的“操作系统”:多集群、GPU、MCP、HITL。推理侧推 vLLM 与 llm-d。相对 VMware/Nutanix,它是 K8s 原生,VM 通过 OpenShift Virtualization(KubeVirt)。适合已有 OpenShift 的应用团队,而不是 vSphere 管理员的第一跳(除非同时买虚拟化迁移)。Red Hat
互连:NVSwitch 仍是 scale-up 事实标准,但标准在围攻
Next Platform 2026-08-31:Nvidia 滚动 12 个月 InfiniBand 销售额估约 257.4 亿美元,Ethernet+NVSwitch 合计约 256.7 亿美元(作者估算,不是 Nvidia 分项财报)。判断:大规模集群的 IB 可能已接近峰值,企业与模型公司倾向 Ethernet;scale-up 目前 NVLink/NVSwitch 仍占绝对多数,UALink / ESUN 在挑战。MediaTek 获 35 亿美元可转债投资以采用 NVLink Fusion,说明 Nvidia 在用资本把自定义 XPU 拉进自己的机架。Next Platform NVSwitch STH MediaTek
HCI 软件进 NVL72 的前提是 正确暴露拓扑(CPU–GPU–NVLink–网卡),而不是再做一层存储 HCI。
谁在卖什么
| 厂商 | 产品 | 角色 | 2026 状态 |
|---|---|---|---|
| Broadcom VMware | VCF 9 + Private AI Cloud + AI Factory | 企业私有 AI 云全栈 | Explore 2026 发布;vSphere 9.1 认证 Hypervisor |
| NVIDIA | GB200/GB300 NVL72、NVAIE、Certified Hypervisors | 硬件+软件资格 | Qualified server ≠ Certified system |
| Cisco | Secure AI Factory + Supermicro 机架 | 网络+验证+渠道 | 计划 2026-10 开卖 |
| Dell / HPE / Lenovo / SMC | OEM AI Factory / ReadyNode | 出货主力 | Dell 本季 AI 服务器收入 164 亿美元(财报) |
| Red Hat | OpenShift AI | K8s AI PaaS | Agent 蓝图 + vLLM |
| Mirantis | k0rdent AI | K8s 原生 IaaS + VMaaS | NVL72 认证;VMaaS 预览 |
| Rafay | Rafay Platform / Token Factory | GPU PaaS | HGX+NVL72 认证 |
| OpenNebula | 7.2 + OneKS | 基础设施优先云 | GB200 ARM 透传认证 |
| Nutanix | NCP + NKP + NAI | 企业双原生 | 大模型多节点仍预览;更偏 8B 与 Agent |
客户要什么 vs 缺口
要什么
- 多租户:把一张 NVL72 切给多个团队而不掉集合通信性能。
- 接近裸金属的 NCCL/NVLink 性能 + VM 的隔离、快照、快速回收。
- 从金属到模型的一体交付(Cisco CVIS、VMware+MetalSoft、OEM rack)。
- 主权与审计:模型、权重、日志不出境。
- 电力/液冷/光模块一起设计,而不是 IT 单独买服务器。
缺口
- GB200 级仍以 PCI 透传 为主,vGPU/MIG 在 NVL72 上不是主故事;多租户粒度常常是“整 GPU 或整计算盘”。
- 认证轨道分裂:x86 HGX vs Grace ARM NVL72,国内若无 Grace 货,认证证书不能直接复用。
- HCI 分布式存储几乎肯定不是 checkpoint / KV Cache 的最优路径(见
data-domain.md)。 - 中国客户还要昇腾超节点并行故事;只讲 CUDA 过不了信创标。
对我方产品规划的可执行含义
- 把“NVIDIA-Certified Hypervisor”列为 2026–2027 硬件生态 KPI,至少覆盖:HGX B200/B300 透传、拓扑感知调度、NCCL 回归。没有证书就不要在 AI Factory 标书里写“近裸金属”。
- 产品拆成两层报价: 企业双原生(对标 Nutanix/VCF 业务+小模型) vs AI Factory 管理面(对标 k0rdent/Rafay/OpenNebula)。用同一套 HCI 节点硬扛 NVL72 会同时输给两边。
- 调度必须拓扑感知。 k0rdent 公开强调 NVLink 与 Spectrum-X 的放置;这应成为 GPU 调度的默认,而不是可选亲和性标签。
- 透传是 NVL72 的诚实默认,vGPU 留给 L40S/L4/分支。 与
ai-ready.md一致。 - 与 OEM 机柜绑定参考架构(液冷、Spectrum-X/IB、对象存储),不要只认证一台 2U 四卡。Cisco–Supermicro 说明渠道会买“整柜+验证报告”。
- 国产轨道单独做。 昇腾超节点、华为 Atlas 与 NVIDIA 认证是两套资格;混在一个“AI 就绪”开关里会在政企标书被废标。
出处
- VMware Private AI Cloud:https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559
- Dell 财报转述:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866
- Cisco Secure AI Factory:https://www.servethehome.com/cisco-secure-ai-factory-with-nvidia-expands-to-supermicro-rack-scale-systems/
- k0rdent 认证:https://www.mirantis.com/blog/mirantis-k0rdent-ai-certified-through-the-nvidia-certified-hypervisors-program/
- OpenNebula GB200:https://opennebula.io/blog/product/opennebula-validation-gb200-nvl72/
- NVAIE 支持矩阵:https://docs.nvidia.com/ai-enterprise/release-8/8.1/support/support-matrix.html
- NVSwitch 评论:https://www.nextplatform.com/connect/2026/08/31/in-the-long-run-nvidia-nvswitch-is-the-infiniband-of-scale-up-ai-networks/5293474
- NVIDIA–MediaTek:https://www.servethehome.com/nvidia-and-mediatek-ink-3-5b-investment-deal-accelerate-nvlink-fusion-adoption/
- OpenShift agentic:https://www.redhat.com/en/blog/agentic-ai-red-hat-openshift-what-enterprises-are-doing-right-now
数据域:数据库、备份对象、向量、Lakehouse vs HCI vs 三层
日期:2026-09-03
场景定义
“数据域”指企业为不同数据形态选择承载位置的决策,而不是再买一套存储品牌。2026 年至少四类负载在抢同一批介质与机架:
| 域 | 典型系统 | 对延迟/协议的要求 | 传统落点 |
|---|---|---|---|
| 事务 DB | Oracle/SQL Server/国产库、MySQL/PG | 低延迟块、同步复制、FC 或 NVMe | 三层 SAN 或 HCI 全闪 |
| 备份 / 对象 | 备份库、S3、归档 | 吞吐、不可变、成本 | 专用备份一体机 / 对象集群 |
| 向量 | Milvus、Qdrant、pgvector | 高 QPS、内存+NVMe、召回 | 新,常临时放 HCI VM |
| Lakehouse / AI 数据 | Iceberg + 对象、特征、checkpoint、KV Cache | 大吞吐、S3、GPU 旁路 | 专用 AI 存储 / 并行文件 |
HCI vs 三层不再是宗教问题:Gartner 2026-08 要求把 虚拟化与存储当联合体评估,并警告不要把数据绑死在单一 hypervisor。
为何现在重要
- 换 hypervisor 的摩擦在数据面。 同一篇 Gartner 分析:买方优先多 hypervisor、容器互通、自动 VM 转换;存储要从块/文件/对象分立产品变成统一控制面;到 2029 年消费型 STaaS 将替代 50% 本地企业存储 capex(2026 年初为 25%)——分析师预测。Virtualization Review
- 成本环境异常。 Gartner 建议为 2027 年按 2025 存储支出的 250%–300% 做预算(内存与存储涨价,AI 争硅)。这会逼客户把冷数据打到磁盘/磁带,把热数据留在 NVMe——HCI 单一层定价会很难看。
- AI 把四类新 IO 写进标准。 MLPerf Storage v3.0:训练(Unet3D/RetinaNet,模拟 B200 或 MI355)、checkpoint(8B/70B/405B/1.25T Llama 风格)、向量库(Milvus 1M×1536)、KV Cache(会话数/tok/s)。新增 S3 访问层;约 1/6 提交走 S3。传统 NAS 巨头(稿中点名 DDN、Dell、华为、IBM、NetApp、VAST、WEKA)本轮缺席或很少出现。Blocks & Files
- 对象成为主权 AI 的数据底座叙事。 MinIO 与沙特 PIF 旗下 HUMAIN 共建 HUMAIN Fabric,作为 HUMAIN ONE/OS/Brain/Create 的数据与记忆层。这是 厂商合作新闻,不是中国 TAM,但说明“模型公司要对象+记忆,不是要 HCI”。Blocks & Files
- 备份域被 Agent 化。 CrowdStrike Charlotte Agentic SOAR 可触发 Commvault 锁定备份/送 Cleanroom、与 Rubrik 做身份恢复闭环;VAST 把 Falcon sensor 做进 AI OS。数据保护从“夜批”变成安全 Agent 的动作。Blocks & Files 2026-09-02
2025–2026 动态
事务库:仍要块,且常要求外置
Nutanix 自己把 Database Service / 外置存储列为新增长(分析师转述)。中国金融核心库极少把日志盘放在“与桌面 VM 混部的 HCI”上;更常见的是 HCI 跑应用 VM,库走 SAN 或独立全闪。dHCI(dhci.md)正是为这一裂缝发明的。
Gartner 点名的换平台目标(OpenShift、AHV、Azure Local、KubeVirt)都要求存储 hypervisor 无关。若我方存储只能在自有 hypervisor 上提供完整数据服务,会在“先换计算、存储明年再说”的项目里输给 NetApp/PowerStore。
向量:从实验 VM 到存储产品特性
- Qdrant FineWeb-10B 把评测推到 100 亿向量,原文比向量更大(28.66 TB vs 24.47 TB),打击“只存 embedding、丢掉 payload”的基准习惯。Blocks & Files
- SmartX 公开 Qdrant on HCI 调优(厂商实验,见
small-models.md):分层 NVMe+HDD、RDMA、压缩+rescore。 - Nutanix NKP 2.19 应用目录点名 Milvus(与 Kubeflow、Slurm)——向量库被当成 K8s 应用,而不是存储阵列功能。Virtualization Review
规划二分:千万级以内、可与业务同集群的向量 → HCI VM/容器;亿级 + 多租户 RAG 平台 → 独立向量/对象层。
Lakehouse / AI 数据路径
- MLPerf 工作组共同主席 Anderson:厂商/组织观点 随着上下文到万亿级,对象存储可能成为文件系统的可行甚至首选替代;现在就加 S3 是为了让买方有数据。
- Everpure 提交 FlashBlade//EXA 在 405B/1.25T checkpoint 与 KV Cache 类别自称领先(例如 1.25T、1024 模拟加速器、30 数据节点:写 877.52 GiB/s / 17.74s,读 588.28 GiB/s / 28.99s)。厂商提交,且本轮缺席者名单很长,不能当市场结论。
- Gartner 建议把元数据索引、语义标签、向量生成做到存储内,减少 ETL 与出境。
备份对象与勒索
身份与 AI 已是 CSA 2026 云威胁榜前两名;误配置延伸到向量库、RAG、MCP(见 agent-ready.md)。备份域要求:不可变、与安全 Agent 的 API、Cleanroom。HCI 自带备份若不能被 SOAR 调用,会被 Commvault/Rubrik 方案在安全标书里边缘化。
谁在卖什么
| 域 | 谁在卖 | 产品抓手 | 与 HCI 的关系 |
|---|---|---|---|
| 块 / 事务 | NetApp ONTAP、Dell PowerStore、HPE Alletra、vSAN、国产全闪 | NFS/FC/NVMe、快照、双活 | dHCI 外置或 HCI 全闪二选一 |
| 对象 / lakehouse | MinIO、Dell ObjectScale、Everpure、国产对象 | S3、AI fabric | 不该跑在 HCI 数据盘上充数 |
| 向量 | Qdrant、Milvus(Zilliz)、pgvector | ANN、量化、磁盘优先 | 中小规模可 HCI;大规模独立 |
| 备份 | Commvault、Rubrik、Veeam、国产备份 | 不可变、身份恢复、SOAR | 要认证我方 hypervisor |
| AI 并行存储 | Everpure EXA 等 MLPerf 提交者 | checkpoint、KV Cache | GPU 机柜旁路,非 HCI |
Dell 本季存储收入 49 亿美元(+26% YoY,财报转述),PowerStore 连续十季增长——说明 三层阵列并没有因为 HCI 消失,AI 还在给传统存储加单。
客户要什么 vs 缺口
要什么
- 一张图:哪类数据在哪一层、什么协议、谁负责备份。
- 换 hypervisor 时数据库 LUN 不动。
- RAG 的向量与文档不出域、可审计。
- GPU 训练/推理不被备份窗口和向量 compaction 打满磁盘。
- 对象接口(S3)给数据平台,而不是只给备份软件。
缺口
- HCI 厂商很少公布 KV Cache / checkpoint 数字;MLPerf v3.0 也几乎没有 HCI 软件提交。
- 向量与事务库混部时的 QoS 缺少产品级隔离(存储 QoS + GPU 抢 IO)。
- 国产备份软件对 KVM 新平台的 CBT/快照认证往往滞后于迁移项目。
- “超融合双活”与“阵列双活”在 RPO/RPO 语义上被混用,方案评审容易翻车。
对我方产品规划的可执行含义
- 发布《数据域放置指南》作为标准交付物,四行表:DB、备份、向量、AI 对象——每行写推荐介质、协议、是否与业务 VM 同集群。销售禁止用“我们全闪 HCI 全能跑”。
- 块协议:生产库支持外置阵列一等公民(对齐 Nutanix+NetApp),自研分布式块定位在 VDI/应用/中小库。
- 对象网关做成平台能力(S3 兼容),即使后端先用合作伙伴。MLPerf 已经把 S3 写进训练/checkpoint。
- 向量:官方支持矩阵 + 参考配置(内存优先/磁盘优先/量化),规模阈值写进文档(例如千万级同集群、之上外置)。对标 SmartX 公开方法,但要用第三方工具可复现。
- 备份:提供 SOAR/API 钩子(不可变锁定、Cleanroom 级恢复、身份对象粒度),否则安全部会指定 Rubrik/Commvault,我方只剩“被备份的 hypervisor”。
- 不要用 HCI 节点冒充 AI 存储。 GPU 机柜旁路 NVMe/对象;HCI 负责控制面 VM、元数据、中小 RAG。
出处
- Gartner 存储与 replatforming:https://virtualizationreview.com/articles/2026/08/27/gartner-hypervisor-replatforming-is-reshaping-enterprise-storage.aspx
- MLPerf Storage v3.0:https://www.blocksandfiles.com/ai-ml/2026/09/01/mlperf-storage-benchmark-updated-for-modern-ai/5293617
- Qdrant 10B:https://www.blocksandfiles.com/ai-ml/2026/09/01/it-aint-big-enough-qdrant-uprates-vector-benchmark-dataset-size-1000x/5293826
- MinIO–HUMAIN:https://www.blocksandfiles.com/object/2026/09/01/minio-goes-to-saudi-arabia-to-build-humain-ai-data-fabric/5293687
- CrowdStrike–Commvault/Rubrik/VAST:https://www.blocksandfiles.com/security/2026/09/02/crowdstrikes-security-agents-can-trigger-commvault-rubrik-and-vast-data-cyber-recovery/52
- Dell 存储增长:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866
- Nutanix Milvus 目录:https://virtualizationreview.com/articles/2026/08/26/nutanix-expands-cloud-platform-for-production-agentic-ai.aspx
边缘与 ROBO:2 节点 HA、许可地板与 VMware 减配
日期:2026-09-03
场景定义
边缘 / ROBO 指 人少、空间小、WAN 不稳定、站点数量多 的基础设施:门店、工厂产线旁、油站、医院科室、船、变电站、地市局。技术形态是 1–3 节点 HCI,而不是 8 节点全闪。2026 年决定胜负的不是功能清单,而是:
- 2 节点 HA 如何做仲裁(云 witness vs 本地 witness vs 不允许)。
- 许可地板:最小核数、最小站点数、每站点上限。
- 无人值守生命周期:谁能在 14,000 个点升级而不派工程师。
- 边缘 AI:本地 SLM / 视觉 / 机器人,而不是把视频送回核心。
为何现在重要
- VCF 把边缘收进全栈,但设了地板。 VCF Edge 9.1(2026-05-05 宣布)把原 Remote Clusters 收成 Edge:VM + K8s + AI 同一操作模型;官方要求最少 10 个站点、每主机最少 8 核、每站点最多 256 核、必须用 VCF Operations 授权;主机须与核心负载物理隔离(另机柜/另交换机)。Broadcom TechDocs VCF Edge VCF 博客
- 单机房/个位数站点被 VCF Edge 排除。 行业解读:Essentials 等入门 SKU 已消失,VCF Edge 禁止当核心机房用;一家只有一个机房的公司面对的是 VVF/VCF 的 16 核/CPU 起售逻辑(第三方综述,规划时以 Broadcom 官方报价单为准)。INTROSERV
- 2 节点是边缘的真实 BOM。 Azure Local 门户支持双机无存储交换机;Scale Computing 2026 为 2 节点加 本地物理 witness;Nutanix NCI-Edge 把集群上限写成 5 节点 / 25 VM / 单 VM 96GB。
- Google 2026 调查:90% 认为边缘生成式部署重要(72% 极重要/很重要),理由是延迟、成本、断网。Virtualization Review
- 专用边缘虚拟化在吃 VMware 的“太贵/太重”。 NodeWeaver 做纯边缘、永久许可;Carnival 在至少 29 艘船上跑(客户口述经 The Register)。Cisco 为通话应用做 NFVIS-for-UC,避免客户为几台 CUCM 买 VCF。
2025–2026 动态
Nutanix NCI-Edge
官方 datasheet:NCI-Edge 与 NCI 同能力子集,面向 ROBO;集群最多 5 节点、最多 25 VM、单 VM 内存上限 96GB。Starter/Pro/Ultimate 分层含 AHV、NKP、DR、GPU 透传(Pro 起)等。这是 明确的功能阉割换低价边缘 SKU,不是“完整 NCI 缩小安装”。Nutanix NCI-Edge
Nutanix 还在推边缘 KubeVirt(The Register 标题,2026-04 抓取页正文被导航污染,规划上按“NKP 往裸金属/边缘延”处理,细节以 Nutanix 官方发行说明为准)。NKP Metal 把操作系统/固件生命周期套到物理机,适合无虚拟化层的边缘。
Scale Computing HyperCore
- 定位:自愈 HCI,无独立存储协议/VSA,边缘到核心同一套软件。公开材料仍把 VMware alternative 当主信息。
- 2 节点 + 本地 witness(2026): witness 只要约 4GB RAM、x86、HCOS 存储;不跑 VM、不进数据路径;无云依赖,适合断网/隔离。Scale 博客
- Fleet Manager 管多站点。Theory of Operations 白皮书日期 2026-08-24。
Azure Local
Microsoft Learn(azloc-2604/2605):
- 门户支持:单机无交换机、双机无/有存储交换机、3–16 机有交换机。
- 三机及以上无存储交换机:门户不支持(ARM 模板部分可以)。
- 双节点必须 Cloud Witness(Azure 存储账户),不能多集群共用同一账户。
- 出站连接检查是部署前提——对“完全断网工控网”不友好。
Nutanix CEO 在 .NEXT 称 Azure Local “不是大企业在用”(竞品表态),同时 Nutanix 与 Microsoft 做 AVD 混合落地,理由是高端桌面要低延迟。The Register
VCF Edge 9.1 地板(规划必须记住的数字)
来自 Broadcom 官方 Edge Models 表:
| 项 | 要求 |
|---|---|
| 站点分布 | ≥ 10 站点 |
| 每主机 CPU | ≥ 8 核 |
| 每站点 CPU | ≤ 256 核 |
| 位置 | 与数据中心负载物理分离 |
| 许可 | VCF Operations 强制 |
Pattern 8 允许单主机 vSphere Supervisor 边缘,但官方写明:单点故障、无本地 vMotion HA。这是“有 K8s 的薄边缘”,不是 2 节点 HA。
VxRail 升 VCF 9.1:双节点、satellite 暂无支持路径(C4C / Dell–VMware 2026-06 说明)。这是边缘 VxRail 客户的明确缺口。
其他边缘玩家
- NodeWeaver:只做边缘;混杂旧 x86;永久许可。CTO 称 Broadcom 边缘 as-a-service “贵且限制多”。Carnival 用其替换船上厂商 PC。The Register
- Cisco NFVIS-for-UC:只跑 Cisco 通话应用;2026 Q1 上市承诺,3 月上价目表。社区抱怨约 420 美元/月(用户帖,非正式价目)。Nutanix 同步支持 Cisco calling on AHV。The Register Cisco
- Proxmox:ARM64、全球 7×24 企业支持(厂商 2026 公告,抓取于 proxmox 目录)——对边缘瘦站点与国产 ARM 板有吸引力,但不是 ROBO 舰队产品。
- NVIDIA Jetson Orin Nano 2:H1 2027,入门边缘 AI 模组,见
small-models.md。
谁在卖什么
| 厂商 | 产品 | 最小 HA | 许可/容量地板 | 适合 |
|---|---|---|---|---|
| Broadcom | VCF Edge 9.1 | 可单机 Pattern,但官方 HA 仍看集群 | ≥10 站点,≤256 核/站点 | 零售/制造舰队,已买 VCF |
| Nutanix | NCI-Edge | 典型 3 节点;Edge SKU 限 25 VM | 25 VM / 96GB RAM/VM / 5 节点 | 要与核心 NCP 同一操作模型的 ROBO |
| Scale | HyperCore | 2 节点+本地 witness | 软件订阅,无 10 站点地板 | IT 极少的门店/工厂 |
| Microsoft | Azure Local | 2 节点+云 witness | Azure 订阅与出站 | 已 Azure Arc 化的企业 |
| NodeWeaver | 边缘平台 | 混硬件集群 | 永久许可(厂商自称) | 船队、无标准硬件 |
| Cisco | NFVIS-for-UC | 应用专用 | 独立 PID 月费 | 只为 CUCM 离开 VMware |
| 国产 HCI | 深信服/SmartX/ZStack 等 | 常见 2/3 节点 | 国内报价,不在此臆造 | 政企地市、工厂 |
客户要什么 vs 缺口
要什么
- 断网仍 HA(很多工厂/政务内网不能用云 witness)。
- 2 节点价格接近 1 节点,不要为仲裁买第三台生产节点。
- 总部一个人管几百个点:镜像、证书、GPU 驱动。
- 现场无 SAN、无光纤工程师。
- 可选:一张推理卡跑视觉/SLM。
缺口
- VCF Edge 的 10 站点地板把“3 个分园”类项目推给别人。
- Azure Local 强依赖云 witness 与出站。
- NCI-Edge 25 VM 对“小数据中心冒充边缘”不够,对真正门店又可能功能过满。
- 国产 2 节点方案的仲裁实现(仲裁盘/见证 VM/第三站点)文档质量参差,POC 必须做“杀节点 + 断 WAN”双故障。
- 边缘 GPU 驱动与安全补丁的舰队升级几乎没有 HCI 厂商讲清楚。
对我方产品规划的可执行含义
- 做真正的 2 节点 SKU:本地 witness,默认可断云。 对标 Scale 2026 本地 witness,而不是只抄 Azure 云仲裁。政务/工控标书会把“必须访问公有云”写成否决项。
- 许可按站点或节点,不要按核卷到边缘。 VCF 的核地板是我方话术:同样 8 核小站,对方要凑 10 个点才配 Edge。
- 舰队控制面独立于集群控制面。 对标 Scale Fleet Manager / VCF GitOps:配置一次,推到 N 站。NodeWeaver 用“14,000 点不能一艘一艘登船”说明失败模式。
- 边缘 AI 作为附加包:1 张 16–24GB 卡或 Orin 级模组 + 本地向量,不要把 NVL72 故事讲进门店。
- 应用专用 hypervisor 会继续出现(Cisco UC、未来的安全/工控 appliance)。我方应提供“轻量运行时 + 认证清单”,承接从 ESXi 下来的虚拟电器,而不是要求客户先买全栈。
- 明确 NCI-Edge 式的容量天花板要不要学。 若学:用低价 SKU 保护核心利润。若不学:用同一软件无限额,但要能讲清支持边界。建议:软件同一内核,许可证用站点规模档,而不是砍功能。
出处
- VCF Edge 模型:https://techdocs.broadcom.com/us/en/vmware-cis/vcf/vcf-9-0-and-later/9-1/design/vmware-cloud-foundation-concepts/vcf-edge.html
- VCF Edge 9.1 宣布:https://blogs.vmware.com/cloud-foundation/2026/05/05/announcing-vmware-cloud-foundation-edge-9-1-a-scalable-autonomous-edge-platform/
- Azure Local 拓扑:https://learn.microsoft.com/en-us/azure/azure-local/deploy/deployment-introduction?view=azloc-2604
- Azure Local 双节点:https://learn.microsoft.com/en-us/azure/azure-local/plan/two-node-switchless-two-switches?view=azloc-2604
- NCI-Edge datasheet:https://www.nutanix.com/library/datasheets/nci-edge
- Scale 本地 witness:https://www.scalecomputing.com/blog/high-availability-for-2-node-edge-clusters-sc-hypercore-virtualization-suite-now-supports-a-local-witness
- NodeWeaver:https://www.theregister.com/software/2026/04/16/nodeweaver-perpetual-licensing-beats-vmware-nickel-and-dime/5222379
- Cisco NFVIS:https://www.theregister.com/software/2026/02/16/cisco-set-to-release-hypervisor-as-vmware-alternative/4965162
- Google 边缘 AI 调查:https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says
AI-Ready 虚拟化:认证 Hypervisor、vGPU/MIG/透传、NVAIE、国产加速器
日期:2026-09-03
场景定义
“AI-Ready”在 2026 年已从 PPT 变成 可核对的资格表:
- NVIDIA-Certified Hypervisor / NVAIE 支持矩阵:哪些 hypervisor 版本 + 哪些 GPU + 哪种虚拟化模式(vGPU / MIG-backed vGPU / passthrough)被支持。
- 拓扑保真:多 GPU、NVLink、NUMA、RDMA 是否被正确暴露。
- 国产加速器虚拟化:昇腾 vNPU、海光 DCU、寒武纪 MLU 的切分与 K8s 设备插件。
- 运行时组合:VM 内 GPU、KubeVirt、裸金属 NKP/OpenShift。
没有这张表,销售说“支持 GPU”在 2026 的 AI 标书里等于没说。
为何现在重要
- 企业要把生产推理放回私有云(VMware 调查,见
large-models.md),但 GPU 太贵,必须共享。 - Agent 使 GPU 与 CPU 沙箱同时涨(Google 83% 要升级基础设施)。
- NVIDIA 用认证项目给 neocloud 和 VCF 发通行证;国内政企用信创名录给昇腾/海光发通行证。两条资格互不替代。
- Nutanix FY26 增强与 AMD、Lenovo、NetApp、Nvidia 的协议(CEO 信,经 Blocks & Files 转述),说明 HCI 公司必须把加速器生态写成合同,而不是驱动备注。
2025–2026 动态
NVIDIA 虚拟化模式(以公开矩阵为准)
NVAIE 8.1 / 7.x 支持矩阵要点:
- HGX/工作站级 GPU:VMware vSphere 与 RHEL KVM 上广泛支持 vGPU Guest 与 passthrough;OpenShift 4.18–4.22 在文档中出现 vGPU Guest/Data Center。
- GB200 NVL72 / GB300 NVL72:要求 NVIDIA-Qualified server,不是普通 Certified Systems;部分 DGX GB200 条目仍写 bare metal only。把“我们通过了 vSphere 认证”直接写到 NVL72 方案是错误的。NVAIE 8.1
- vGPU 软件在 VMware 侧:VCF 9.1 起同时支持 time-sliced 与 MIG-backed vGPU(vGPU 文档 20.2+ 叙述)。ESXi 8.0 需特定更新才能支持部分 Blackwell 专业卡。NVIDIA vGPU VMware 验证平台
- OpenShift Virtualization:GPU Operator ≥ 25.10 才能较好使用 MIG-backed vGPU;Red Hat 测试路径是让 Virtualization 管 mediated device,GPU Operator 只装驱动(
vgpuDeviceManager.enabled=false)。OpenShift docs commit NVIDIA GPU Operator × OSV
认证 Hypervisor 项目(2026)
已公开通过者(不完全清单,以 NVIDIA 名单为准):
| 平台 | 轨道 | 模式重点 |
|---|---|---|
| VMware vSphere 9.1 | Blackwell + Hopper | 近裸金属,含集合通信/RDMA/拓扑 |
| Mirantis k0rdent AI | GB200 NVL72 + Grace | 拓扑感知;VMaaS 预览 |
| Rafay VMaaS | HGX + NVL72 | 多租户 GPU PaaS |
| OpenNebula 7.2 | GB200 NVL72 ARM | PCI 透传 + OneKS |
AMD Instinct 虚拟化
ROCm 文档:MI350/MI355 在 KVM 上支持 passthrough 与 SR-IOV(GIM 驱动);MI300X 另有 ESXi passthrough。ROCm 10 兼容性矩阵出现 Ubuntu 26.04、ESXi 9.1 SR-IOV 等组合。以 ROCm 矩阵为准,不要假设每家 HCI 都已集成 GIM。 ROCm system requirements
VMware Private AI Cloud 厂商自称 支持 MI350 + ROCm。
国产加速器(2026 公开信息,参数以厂商/评测为准)
| 加速器 | 2026 公开定位 | 虚拟化/平台含义 |
|---|---|---|
| 华为昇腾 910C / 950 路标 | 超节点训练;华为 2025 全联接称 2026 Q4 Atlas 950 超节点及 SuperCluster | 生态在 CANN/MindSpore,虚拟化常为整卡或厂商 vNPU,不是 NVIDIA vGPU |
| 海光 DCU(K100 等) | 强调 CUDA/ROCm 迁移;传统企业存量代码 | 更贴近“换卡不换栈”,适合 HCI 透传 |
| 寒武纪 MLU590/690 | 推理、互联网搜推广 | 需要 MLU 设备插件;与昇腾一样要独立支持矩阵 |
| 鲲鹏 / 飞腾 | 主机 CPU(见 hardware.md) | ARM 虚拟化 + 加速器是两套认证 |
华为官方新闻:Kunpeng 950 计划 2026 Q1(96/192 核两款,机密计算);Atlas 950 SuperCluster 与超节点同步 2026 Q4。厂商路标。 华为
第三方选型文把“万卡训练→昇腾、存量 CUDA 迁移→海光、高并发推理→寒武纪”当作 2026 经验法则,不是份额数据,POC 必须按框架与算子覆盖复测。
其他
- VergeIO 抓取页含 “Abstracted GPU infrastructure / VergeIQ private on-prem generative AI”——小型 VMware 替代选手也在用 GPU 抽象讲 AI,但是否入 NVAIE 矩阵需单独核对。
- Nutanix NCI Pro 含 GPU passthrough;NAI 支持 NIM 断网与多 GPU 预览。
- Open Secure AI Alliance 2026-09-02 转入 Linux 基金会,范围含硬件身份、隔离、密钥——AI-Ready 将从驱动列表扩展到证明链。Virtualization Review
谁在卖什么
| 厂商 | AI-Ready 卖法 |
|---|---|
| NVIDIA | NVAIE 订阅 + 认证矩阵 + NIM |
| VMware | VCF AI ReadyNode + 认证 Hypervisor + vGPU |
| Red Hat | OpenShift + GPU Operator + OpenShift Virtualization vGPU/MIG |
| Nutanix | AHV 透传 + NAI + NKP AI 目录 |
| k0rdent / Rafay / OpenNebula | 认证 Hypervisor / VMaaS |
| 华为 | FusionCube / 鲲鹏+昇腾超节点(一体栈) |
| 海光生态 HCI | x86 兼容主机 + DCU 透传 |
| AMD | MI350 SR-IOV/GIM + ROCm |
客户要什么 vs 缺口
要什么
- 一张写得清的支持矩阵:卡型号 × 模式 × 客户机 OS × 驱动分支(NVAIE vs 公版)。
- 开发测试用 vGPU/MIG,生产训练用透传,不要一种模式打天下。
- 国产卡与 NVIDIA 卡能在同一套运维里看功耗、故障、占用。
- 断网安装(军工、政务)。Nutanix 把 NIM air-gap 写成 NAI 2.8 特性,说明这是招标项。
缺口
- 多数国产 HCI 只有透传,无时间切片/MIG 等价物,GPU 利用率被“一卡一项目”锁死。ZStack 公开文章写过客户 GPU 利用率约 30% 的痛点(厂商观察)。
- NVL72 与 L40 混在“支持 GPU”一句里,实施时拓扑全错。
- 昇腾/MLU 的虚拟机热迁移、快照一致性几乎无公开企业级矩阵。
- 驱动、CUDA/CANN、内核、hypervisor 四版本耦合,升级窗口比业务 VM 更脆。
对我方产品规划的可执行含义
- 发布两张矩阵,不要一张。 矩阵 A:NVIDIA(vGPU / MIG-backed / passthrough × GPU 代际)。矩阵 B:昇腾/海光/寒武纪(透传 / vNPU / K8s device plugin)。混用会在信创与 CUDA 标书两边被打回。
- 默认策略: L4/L40S/专业卡 → vGPU 或 MIG 给 VDI/开发/7B 推理;HGX/NVL72 → 透传 + 拓扑调度;国产卡 → 先透传 GA,切分能力单列技术预览。
- NVAIE 兼容作为可选订阅集成(驱动源、NIM 目录),即使客户不买 NVIDIA 软支也要能装公版。
- 把 GPU 生命周纳入 LCM:固件、驱动、CUDA/CANN、容器运行时一次编排。对标 Nutanix LCM / VMware vLCM,否则 AI 集群会变成“不能升级的孤岛”。
- 利用率产品化: 排队、MIG 切分、多 LoRA、空闲回收。ZStack 把 30%→70% 当方法论宣传,说明客户已经用这个 KPI 审厂商。
- 断网包: 模型、驱动、校验签名(TrueSource/OSAA 方向)进离线仓。
出处
- NVAIE 8.1 矩阵:https://docs.nvidia.com/ai-enterprise/release-8/8.1/support/support-matrix.html
- vGPU on VMware 验证平台:https://docs.nvidia.com/vgpu/20.0/grid-vgpu-release-notes-vmware-vsphere/validated-platforms.html
- OpenShift vGPU+MIG:https://docs.nvidia.com/datacenter/cloud-native/openshift/latest/openshift-virtualization.html
- k0rdent:https://www.mirantis.com/blog/mirantis-k0rdent-ai-certified-through-the-nvidia-certified-hypervisors-program/
- OpenNebula:https://opennebula.io/blog/product/opennebula-validation-gb200-nvl72/
- ROCm 虚拟化:https://rocm.docs.amd.com/projects/install-on-linux/en/docs-7.1.1/reference/system-requirements.html
- 华为超节点路标:https://www.huawei.com/cn/news/2025/9/hc-xu-keynote-speech
- OSAA→LF:https://virtualizationreview.com/articles/2026/09/02/nvidia-founded-open-secure-ai-alliance-moves-to-linux-foundation.aspx
Agent-Ready:MCP 网关与 Agent 治理
日期:2026-09-03
场景定义
Agent-Ready 不是“能调 LLM API”,而是企业把 自主 Agent 当成一种新的工作负载身份 来治理:
- MCP(Model Context Protocol)网关:Agent 与工具/数据之间的统一入口,做鉴权、工具过滤、审计、限流。
- Agent 治理:身份、使命/意图、最小权限、运行时拦截、HITL、可观测、回收。
- 沙箱:Agent 生成的代码默认不可信,需要微 VM / 安全容器隔离。
2026-08 末到 09 初,Broadcom、Nutanix、Red Hat 几乎同时把这一层产品化。本卷宗只写 已在公开网页核验 的名称,避免把内部传闻当产品。
为何现在重要
- Google Cloud 2026 基础设施报告:83% 组织认为要升级才能跑生产 Agent;79% 把安全/治理/MLOps 列为顶级挑战;Agent 可被授权读邮件、查库、调 API,威胁模型不同于聊天机器人。Virtualization Review
- CSA 2026 云威胁榜:IAM 升至第 1;AI 增强攻击第 2、AI 系统被攻陷第 6,均为新上榜。非人类身份(服务账号、机器人、AI Agent)被明确写入 IAM 条目;MCP 与 Agent 权限出现在误配置条目。Virtualization Review
- VMware 介绍 Private AI Cloud 时直接说:OpenAI/Anthropic Agent 逃出沙箱、连到第三方环境的事件,使高安全沙箱成为焦点。Next Platform
- 国内:ZStack 用游戏公司“一夜约 200 万元 Token”的公开演讲当警示(转述,非审计数字),Zentrix 把拦截放在调用前。
2025–2026 动态(三项点名核验)
1. Broadcom AgentMinder —— 已 GA
- 2026-08-31 VMware Explore:AgentMinder 作为企业 Agent 治理与运行时控制,官方新闻稿写 generally available。GlobeNewswire
- 能力(厂商自称):把 Agent 当企业身份;每次工具调用按使命、意图、上下文、风险授权;云原生 AI 网关只把流量导向授权后端;OpenTelemetry 审计;AuthZEN 对接现有授权栈。
- 与 vDefend、Avi Load Balancer 组成三层:身份/意图、工作负载、威胁检测。配套稿
- SiliconANGLE:AgentMinder 独立于 Agent 运行时;可 allow/deny/redirect/redact;Broadcom 自称内部用其处理每日约 3600 万客户相关与 700 万员工相关 API 调用——内部用量,不是客户基准。SiliconANGLE
Tanzu 被指定为 Private AI Cloud 的 Agent 层:deny-by-default 沙箱、MCP、数据产品 marketplace、AI gateway 记日志。
2. Nutanix Agent Gateway —— MCP 管理已 GA
- Agent Gateway 在 NAI 2.7 已 GA(统一 Agent→LLM 流量、Token 限流;当时 MCP 为技术预览)。Nutanix 博客
- 2026-08-26 NAI 2.8:MCP server 管理在 Agent Gateway 中 GA。本地或远程 MCP;按用户/API Key 赋工具权限;本地 MCP 滚动升级。Nutanix 新闻稿 产品博客
- 另一条线:2026-08-10 开源 NCP MCP server(Prism v4 API),让 Copilot/Claude Code/Cursor 类工具在 RBAC/限流/审计下操作基础设施。与 Agent Gateway 分工:前者暴露 Nutanix 平台,后者治理 Agent 对任意 MCP 的访问。
- NKP 上可用 Flow 做 Agent 网络隔离(厂商描述)。
3. Red Hat OpenShift 上的 AgentOps / MCP Gateway —— 框架 + 技术预览
核验结果:“OpenShift AgentOps”不是一个单独 SKU 名称,而是 Red Hat 把 AgentOps 写成 OpenShift AI 上运营 Agent 的框架/控制面。
- Red Hat 主题页定义 AgentOps:监控 Agent 决策、预算、HITL、护栏;并写 Red Hat AI 用 AgentOps control plane 覆盖混合云。Red Hat AgentOps
- 2026 博客:OpenShift/OpenShift AI 是企业 Agent 的基础;AgentOps 是框架无关的运营方法。Red Hat 博客
- MCP Gateway:Red Hat Connectivity Link 中的 技术预览;在 OpenShift AI 里与 MCP Catalog(开发者预览,AI 3.4 叙述)、身份感知工具过滤、敏感调用审批、MLflow 追踪结合。Red Hat MCP Gateway TP
- 开发者蓝图(2026-07-20):MCP Gateway 基于 Envoy + Kuadrant/Authorino;网关不读 prompt,用工作负载身份(SPIFFE/Kagenti)决定工具;沙箱列 Kata。Red Hat Developer
规划口径:对标时写 “OpenShift AI AgentOps 框架 + Connectivity Link MCP Gateway(TP)”,不要写成已 GA 的独立产品名。
国内对照
- ZStack Zentrix:统一模型接入与 Agent 治理,强调调用前拦截、Token 账。抓取页标题《当 Agent 开始访问核心业务,安全边界怎么守?Zentrix 把拦截放在调用之前》。厂商内容。
- SmartX:船舶制造案例路径是 云底座 → 榫卯 AI 平台(模型网关)→ 智能体平台,反对从开源手工部署直接跳到生产。抓取
生态层
- Open Secure AI Alliance 2026-09-02 进 Linux 基金会:Agent 运行时、身份、权限、隔离、护栏。SAFE 项目做事件共享。贡献举例:HPE SPIFFE/SPIRE、IBM/Red Hat Lightwell 签名补丁、NVIDIA 自身模型与 harness。Virtualization Review
- CrowdStrike Charlotte Agentic SOAR 调备份域(见
data-domain.md)——安全 Agent 已在生产工作流里动数据。
谁在卖什么
| 厂商 | 产品名 | 状态(2026-09) | 治理点 |
|---|---|---|---|
| Broadcom | AgentMinder + Tanzu Agent 层 | GA(2026-08-31) | 身份+意图+每次 tool call |
| Nutanix | Agent Gateway + NCP MCP Server | Gateway MCP GA;基础设施 MCP 开源 | 工具权限、Token、滚动升级 |
| Red Hat | AgentOps 框架 + MCP Gateway | Gateway 技术预览;Catalog 开发者预览 | Envoy 策略、HITL、追踪 |
| ZStack | Zentrix | 已公开宣传 | 调用前拦截、Token 账 |
| SmartX | 榫卯 AI + 智能体平台 | 案例阶段 | 先底座再 Agent |
| 开源 | MCP、SPIFFE、Kata 沙箱 | 协议层 | 可被上述网关封装 |
客户要什么 vs 缺口
要什么
- 一个入口:所有 Agent 的工具可见性(谁能调 ERP 写操作)。
- 人类审批高风险动作(转账、删资源、改 AD)。
- 审计能回答监管:哪次 prompt、哪个工具、哪个身份、是否被拒。
- Token 与费用按部门/Agent 配额。
- Agent 跑代码有隔离,逃逸不影响 hypervisor。
缺口
- MCP 服务器爆炸式增长,无网关即影子工具;CSA 已把 MCP 列入误配置面。
- AgentMinder / Nutanix / OpenShift 三套模型不同(意图 vs 工具 ACL vs 工作负载身份),客户会要求“能否对接现有 IAM”,而不是再买一套身份。
- 沙箱密度:每个 Agent 会话一个微 VM 会打爆边缘与 CPU 集群(见
runtime.md)。 - 国内等保/密评还没有把 MCP 网关写成控制项,但金融客户已在询。
对我方产品规划的可执行含义
- MCP Gateway 作为 2026 必做平台组件,哪怕第一期只做:统一 endpoint、API Key、只读/读写工具分级、全量审计。对标 Nutanix 2.8 的 GA 范围,而不是等 AgentMinder 级意图引擎。
- Agent 身份接入现有 RBAC/AD/OAuth,用 SPIFFE 或证书,不要只发一个长寿命 Key。CSA 第 1 名就是这件事。
- 默认 deny 的代码执行沙箱(Kata 或 Firecracker),与模型网关分开部署。VMware 已把沙箱写成 Private AI Cloud 卖点。
- 基础设施 MCP 要有独立产品边界:只读先 GA(查集群、查告警),写操作必须走审批。Nutanix 开源 NCP MCP 会让客户拿 Copilot 直接改生产——我方若做,默认只读。
- 与备份/安全联动预留 API(锁定、隔离、回收),否则 SOAR 会绕过虚拟化平台。
- 话术:Agent-Ready = 网关 + 身份 + 沙箱 + 观测,四件套。 缺一不可写成“智能体平台”。
出处
- AgentMinder 新闻稿:https://www.globenewswire.com/news-release/2026/08/31/3353342/19933/en/broadcom-unveils-agentminder-an-enterprise-solution-for-ai-agent-governance-and-runtime-control.html
- Broadcom 安全三件套:https://www.globenewswire.com/news-release/2026/08/31/3353355/19933/en/broadcom-delivers-end-to-end-security-identity-and-observability-for-agentic-ai.html
- SiliconANGLE:https://siliconangle.com/2026/08/31/broadcoms-private-ai-cloud-spans-infrastructure-agents-data-and-security/
- Nutanix Agent Gateway 介绍:https://www.nutanix.com/blog/introducing-nutanix-agent-gateway
- NAI 2.8:https://www.nutanix.com/blog/charting-the-path-to-governed-agentic-ai-with-nutanix-enterprise-ai-2-8
- Red Hat AgentOps:https://www.redhat.com/en/topics/ai/agentops.md
- OpenShift MCP Gateway TP:https://www.redhat.com/en/blog/control-your-ai-agent-traffic-scale-model-context-protocol-gateway-red-hat-openshift-now-technology-preview
- CSA 2026 威胁:https://virtualizationreview.com/articles/2026/08/24/identity-ai-lead-csas-2026-cloud-threat-list.aspx
- Google Agent 基础设施:https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says
硬件:GPU / CPU / NPU 与虚拟化、HCI 支持矩阵(2026)
日期:2026-09-03
本页 禁止编造份额与价格。性能数字仅在标明出处的厂商/报道中出现。
场景定义
规划 HCI/虚拟化必须回答:哪些加速器与 CPU 能进支持矩阵,以何种虚拟化模式,在哪一代主机上。2026 年硬件分成三层:
- AI Factory 级:GB200/GB300 NVL72、MI350 机架、昇腾超节点。
- 企业服务器级:HGX B200/B300、L40S、国产 PCIe 卡 + Xeon 6 / Turin / 海光 / 鲲鹏。
- 边缘/分支:Jetson、Orin、NPU PC、飞腾嵌入式。
为何现在重要
- 同一条硅供应链同时抽走 HBM、DDR、NAND。Hot Chips 2026 上 Objective Analysis 的 Jim Handy 用现货 DRAM/NAND 约 7× 的量级描述短缺(现货指标,不是合同价);报道称 Nvidia 向 GB200/Vera-Rubin NVL72 客户预告约 15% 涨价(Bloomberg 转述,经 Next Platform)。Next Platform 内存
- Dell 本季传统服务器+网络收入 105 亿美元(+122% YoY,财报转述)——AI 之外的 CPU 服务器也被带动,HCI 扩容同样面对交期。
- 虚拟化软件的差异化正在变成“谁先认证下一张卡”,而不是谁多一个存储特性。
2025–2026 动态与谁在卖什么
GPU / 加速器
NVIDIA Blackwell / GB200 / Rubin 路标
- GB200 NVL72、GB300 NVL72:NVAIE 矩阵要求 Qualified server;部分 DGX 条目 bare metal only(见
ai-ready.md)。 - Cisco Secure AI Factory 2026 映射:Vera Rubin NVL72、GB300 NVL72、HGX B300 NVL8、HGX Rubin NVL8、MGX PCIe;计划 10 月经 Cisco 渠道卖 Supermicro 机架。STH
- Dell:厂商自称 首家出货基于 Nvidia Vera Rubin 平台的机架系统。Blocks & Files
- Hot Chips 2026:NVIDIA 讲 RISC-V 作为 CUDA 主机 CPU 的第三选项(RVA23、ACPI 6.6、PCIe 一致性、P2P);NVLink Fusion 自定义 CPU 要 C2C、约 88 条 PCIe、DOCA/NCCL。SiFive 被点名为 RISC-V Fusion CPU 伙伴。“NVIDIA has plans for RISC-V in its platforms”——路标,不是已出货主机。STH
- NVIDIA 以 35 亿美元可转债投资 MediaTek,换 NVLink Fusion / NVLink-C2C / NVHBM 向 MediaTek 客制 XPU 客户开放。STH
- 边缘:Jetson Orin Nano 2,新 Ampere 系硅,H1 2027 上市。STH
HCI/虚拟化支持(已核验公开材料)
- VMware vSphere 9.1:Certified Hypervisor,Blackwell + Hopper。
- OpenShift:NVAIE 矩阵中的 K8s 发行版;vGPU/透传组合见表。
- k0rdent / Rafay / OpenNebula:NVL72 认证(2026 夏秋)。
- Nutanix:Nvidia 合作协议(FY26,CEO 信);AHV GPU 透传为产品能力,NVL72 认证需单独核对官方名单。
AMD Instinct MI
- MI350/MI355(CDNA4,gfx950):ROCm 支持;KVM passthrough + SR-IOV(GIM)。ROCm
- VMware Private AI Cloud 厂商自称 MI350 + ROCm。
- Nutanix FY26 签/加深与 AMD 的协议(CEO 信转述)。
- UALink:AMD Helios 机架用 Broadcom Tomahawk 6 跑 UALink(Next Platform 叙述)。与 NVLink 竞争 scale-up,HCI 短期仍以 PCIe 卡为主。
Intel Gaudi 与 Xeon 6
- Xeon 6(P-core)与 Gaudi 3 于 2024-09-24 发布:Gaudi 3 带 128GB HBM2e、24×200GbE,走以太网扩展而非 NVLink。Intel Newsroom
- 2026 规划含义:Gaudi 在企业标书中仍是“非 NVIDIA 以太网 AI 网”选项;HCI 若只认证 NVIDIA 会在部分国产替代/反锁定标中缺席。公开的主流 hypervisor Gaudi 矩阵不如 NVIDIA 完整,不要宣称已全面支持,除非我方完成认证。
昇腾
- 华为 2025 全联接:910C 随 Atlas 900 超节点规模部署;950 系列 2026 路标;Atlas 950 SuperCluster(64 个超节点、约 52 万 950DT、FP8 524 EFLOPS)上市与超节点同步,2026 Q4(厂商)。华为新闻
- 虚拟化:政企常见华为栈(FusionCompute / FusionCube + 昇腾),第三方 HCI 多停在 PCIe 透传。vNPU 能力以华为文档为准。
海光 DCU
- 公开选型叙述强调 DTK 对 CUDA/ROCm 迁移、传统行业平滑替换。适合作为 HCI 透传的第一张国产卡,因为客户应用改动小于昇腾。具体型号(K100/K200)以海光当期规格书为准,本页不抄未核验 FLOPS。
寒武纪
- 公开 2026 追踪文把 MLU590/690 放在推理与互联网业务。需要独立设备插件与驱动 LCM;不要假设 NVIDIA GPU Operator 能管。
其他加速器
- Cerebras CS-4 “Nexus”:超频 WSE-3 Turbo,厂商/报道称时钟约 2.8GHz、同 90 万核/44GB SRAM,GA 目标 2026 Q3 晚些时候;背包式液冷机架。这是晶圆级,不是 HCI 节点形态。Next Platform
CPU
| CPU | 2026 要点 | 与 virt/HCI |
|---|---|---|
| Intel Xeon 6 | 2024 发布,企业服务器与 HCI 新平台主力候选 | 嵌套虚拟化:AWS 2026-02 起在 C8i/M8i/R8i 等虚拟实例上开放 VT-x 传递 |
| AMD EPYC Turin(9005) | MI350 主机常见;Cerebras CS-4 主机也用 EPYC | AHV/KVM/ESXi 主流 |
| 海光 x86 | 信创数据库/ERP 首选叙事(兼容性) | 国产 HCI 认证清单核心 |
| 鲲鹏 950 | 华为称 2026 Q1:96 核/192 线程与 192/384;机密计算 | ARM 虚拟化、超节点 host;Proxmox 已有 ARM64 产品化 |
| 飞腾 | 高安全/政务/嵌入式叙事 | 边缘与专用系统多于通用 HCI |
| NVIDIA Grace / Vera | NVL72 主机 CPU(Arm) | OpenNebula 7.2 ARM 认证轨道;传统 x86 HCI 管不到这台机器 |
| RISC-V 主机 | NVIDIA Hot Chips 2026 提出要求集 | 尚早,两代以后才可能广泛;现在做预研即可 |
Nutanix 自称 正在把软件移植到 Arm 以降低客户硬件成本(FY26 财报评论转述)。
NPU
- 终端:HUMAIN OS 规划 2027 商用,厂商称 设备侧跑 260 亿参数模型于 Qualcomm NPU。MinIO/HUMAIN 报道
- 数据中心 NPU:昇腾/寒武纪在国内标书里常被直接叫“NPU/加速卡”。HCI 要按 PCIe 设备 + 厂商 runtime 管理,而不是当 GPU Operator 的特例。
- 智能驾驶座舱 SoC(>1000 TOPS 的公开宣传数字出现在产业报告中,未独立验证)会把推理放到车端,机房侧更多是数据闭环训练——见
emerging.md。
客户要什么 vs 缺口
要什么
- 2026–2027 能到货的 SKU,而不是只有 NVL72 效果图。
- 信创清单与 NVIDIA 清单都能报价。
- CPU 代际(Xeon 6 / Turin / 海光新平台)通过 HCI 兼容性认证,避免“新服务器不能加进旧集群”。
- 内存涨价下的配置建议(少配 DRAM、用 NVMe tiering——VMware 自称 可降每主机成本至多 42%)。
缺口
- 公开矩阵在国产卡+第三方 hypervisor 上极薄。
- Arm(鲲鹏/Grace)与 x86 集群不能混管是多数 HCI 的死角。
- 液冷 CDU、母线槽、1.6T 光模块不在虚拟化 BOM 里,但 NVL72 项目会因这些失败。
对我方产品规划的可执行含义
- 2026 认证优先级: Xeon 6 + Turin 主机;NVIDIA L40S/B200 PCIe 或 HGX;海光 DCU 透传;昇腾 PCIe 透传。NVL72 作为独立轨道,不要塞进标准 HCI ISO。
- Arm 轨道单列: 鲲鹏 950(厂商 2026 Q1)与 Grace 不是同一套镜像。Proxmox ARM64 已说明用户会问。
- 内存通胀应对写成官方配置: NVMe 内存分层、KV Cache 卸载(Nutanix 预览)、小模型优先。禁止仍按 2024 年 1TB/节点报价。
- 拒绝在未认证卡上承诺 vGPU。 透传可以“尽力”,vGPU/MIG 必须跟 NVIDIA 分支走。
- 与服务器 OEM 签联合 BOM(液冷、网卡、GPU 托架),对标 Cisco–Supermicro 的分工:我方管软件 LCM,OEM 管现场换 GPU。
出处
- 内存教程 / 15% 涨价转述:https://www.nextplatform.com/store/2026/08/25/you-probably-forget-how-cheap-memory-used-to-be-and-is-not-so-now/5292363
- Cisco×Supermicro:https://www.servethehome.com/cisco-secure-ai-factory-with-nvidia-expands-to-supermicro-rack-scale-systems/
- NVIDIA RISC-V Hot Chips 2026:https://www.servethehome.com/nvidia-risc-v-for-nvidia-gpus-at-hot-chips-2026/
- NVIDIA–MediaTek:https://www.servethehome.com/nvidia-and-mediatek-ink-3-5b-investment-deal-accelerate-nvlink-fusion-adoption/
- Jetson Orin Nano 2:https://www.servethehome.com/nvidia-announces-jetson-orin-nano-2-entry-level-edge-board-gets-new-ampere-silicon/
- ROCm MI350:https://rocm.docs.amd.com/projects/install-on-linux/en/docs-7.1.1/reference/system-requirements.html
- Xeon 6 / Gaudi 3:https://newsroom.intel.com/artificial-intelligence/next-generation-ai-solutions-xeon-6-gaudi-3
- 华为鲲鹏/昇腾路标:https://www.huawei.com/cn/news/2025/9/hc-xu-keynote-speech
- Cerebras CS-4:https://www.nextplatform.com/compute/2026/08/19/cerebras-overclocks-wse-3-waferscale-engine-to-boost-inference-oomph-in-nexus-cs-4/5289400
- Dell 财报:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866
运行时:容器、沙箱、KVM/QEMU 与嵌套虚拟化
日期:2026-09-03
场景定义
运行时是 hypervisor 之上、模型之下的一层:容器编排如何跑、不可信代码如何隔离、KVM 特性如何暴露给客户。2026 年它被三股力量拉扯:
- VMware 替代 把大量客户推到 KVM(AHV、OpenShift Virt、Proxmox、ZSvirt、OLVM)。
- AI Agent 需要高密度、短寿命、强隔离的执行环境。
- 公有云开始把嵌套虚拟化卖给普通虚拟实例,改变“只有裸金属才能跑 hypervisor/微 VM”的假设。
为何现在重要
- Nutanix 把架构写成 dual-native(VM 与容器一等公民);NKP 获 CNCF Kubernetes AI Conformant(厂商自称)。Virtualization Review
- VMware Tanzu 为 Agent 提供 deny-by-default 沙箱;Red Hat 蓝图把 Kata 列为 Agent sandbox。
- AWS 2026-02-16:虚拟 EC2(非裸金属)支持嵌套虚拟化。AWS What’s New
- Xen 项目把所有发行版安全支持拉到 5 年,服务嵌入式/汽车;XenServer 9 预览回到通用虚拟化——安全认证型运行时与 KVM 主流分流。The Register
2025–2026 动态
容器:K8s、Kata、gVisor
| 运行时 | 隔离 | 2026 企业用法 |
|---|---|---|
| runc / CRI-O / containerd | 命名空间 | 默认,不可信 Agent 不够 |
| gVisor | 用户态内核 | 多租户函数,无 GPU |
| Kata + QEMU/Cloud Hypervisor | 硬件 VM | 多租户、需 VFIO/GPU 时选 QEMU/CH |
| Kata + Firecracker | 微 VM | 最快启动、无 VFIO、无 virtio-fs |
Kata 官方设计文档:Firecracker 后端无文件系统共享、无热插拔、无 VFIO、无 CPU/内存热插拔。Kata virtualization
OpenShift / Nutanix NKP / 国产容器平台仍以 CRI-O 或 containerd + runc 为默认;把 Kata 设为 Agent/MCP 工具的 RuntimeClass 才是 2026 的差异化,而不是给所有业务 Pod 加 Kata。
Nutanix NKP 2.19:NKP Metal(裸金属)、NKP on AHV、AI 目录(Kubeflow、Milvus、Slurm)。Kubernetes 重新碰到硬件生命周期——这是对“K8s 与硬件无关”口号的修正。The Register 标题 2026-04(抓取 txt 曾被导航污染,以 Nutanix NAI/NKP 公告为准)
沙箱:Firecracker、microVM、Agent Sandbox
- Kubernetes SIG 文档给出 Agent Sandbox on Kata-Firecracker 示例:启动约 125ms,优于 kata-qemu 密度;硬性要求
/dev/kvm。Agent Sandbox - Firecracker 不向客户机暴露 VMX/SVM,微 VM 内不能再套 KVM。这是安全模型,不是缺陷。PandaStack
- AWS News Feed 2026-06-22 条目:Lambda MicroVMs 用于隔离用户与 AI 生成代码(标题级信息)。企业私有云要对齐的是这个密度与威胁模型。
- VMware:virtualized container spaces isolating agent code;deny-by-default。
- 对比:gVisor 无 GPU;Firecracker 无 GPU 透传;带 GPU 的 Agent 工具必须走 Kata-QEMU/CH 或普通 VM 透传。
KVM/QEMU 与厂商
| 厂商 | 运行时底座 | 2026 信号 |
|---|---|---|
| Nutanix AHV | KVM 家族 | 双原生;Cisco calling 认证;AVD on-prem |
| Red Hat | KVM + OpenShift Virtualization(KubeVirt) | 企业 VMware 替代主路径之一 |
| Proxmox VE | KVM/QEMU + LXC | 9.x、ARM64、7×24 支持(厂商公告) |
| ZStack ZSvirt/ZSphere | KVM | 开源 ZSvirt,GPL3;厂商自称 控制面 >10000 主机、单 VM 768 vCPU |
| OpenNebula | KVM | NVL72 透传认证 |
| Oracle OLVM | KVM | 抓取有产品文档;VMware 替代清单常客 |
| HPE Morpheus VM Essentials | KVM(HVM) | 可同时管 VMware |
| Cisco NFVIS-for-UC | 专用 | 只跑通话应用 |
| SUSE Virtualization | KVM | 抓取目录存在 |
| VergeIO | 自有 | 抽象 GPU、私有生成式 AI |
| Xen / XenServer 9 | Xen | 5 年安全支持;预览回归通用市场 |
| VMware ESXi | 自有 | VCF 9.1 认证 AI |
ZStack 开源动机直接写客户在问“能否读代码、审计、防止厂商改策略”——这是 Broadcom 事件后 KVM 路线的信任论点。ZStack(抓取 why-we-open-sourced-zsvirt)
AWS 嵌套虚拟化(归档主题,已用官方页核对)
归档 txt 正文被导航污染,以下以 AWS 官方为准:
- 2026-02-16:虚拟 EC2 实例可跑 KVM 或 Hyper-V 嵌套;此前只能在裸金属上做。用例:移动模拟器、车机硬件仿真、WSL。What’s New
- 架构:Nitro(L0)→ 客户 hypervisor(L1)→ 嵌套 VM(L2)。Nitro 把 VT-x 传给实例。
- 初发实例:C8i、M8i、R8i;随后扩到 C7i/M7i/R7i、flex、X8i、I7i 及 GovCloud(2026-06)。Graviton 当时不支持。 AWS 文档
- AWS 仍建议性能敏感负载继续用裸金属。InfoQ:过去有人用最便宜的 Mac 裸金属绕过。
对私有云规划的含义:客户会要求 HCI 虚拟机里跑嵌套 KVM / WSL2 / 移动模拟器 / Agent 微 VM。若 AHV/KVM 不暴露嵌套虚拟化开关,这些测试与开发负载会留在公有云或裸金属。
客户要什么 vs 缺口
要什么
- 一套集群同时跑:普通业务容器、Kata 多租户、Firecracker Agent 沙箱、带 GPU 的训练 Pod。
- 嵌套虚拟化作为可选项(默认关)。
- 开源或可审计的 hypervisor(ZSvirt 论点)。
- Windows 应用(部分客户在看 Linux 上的 Windows 容器化,The Register 2026-02 有相关报道,属小众)。
缺口
- Firecracker 与 GPU 互斥;产品若只推微 VM 会丢掉带工具 GPU 的 Agent。
- 嵌套虚拟化在国产 CPU(海光/鲲鹏)上的测试公开材料少。
- KubeVirt 与“经典 VM 管理面”的操作习惯鸿沟仍是 OpenShift 输给 AHV/ZSphere 的原因。
- 安全:CrowdStrike 类 Agent 在嵌套/微 VM 里的兼容性未进入多数 HCI 矩阵。
对我方产品规划的可执行含义
- RuntimeClass 产品化:
default/kata/kata-fc三档,对应业务、多租户、Agent 沙箱。文档写清 GPU 只能挂在哪一档。 - 嵌套虚拟化: 在 Intel VT-x / AMD SVM 主机提供开关(默认关),对标 AWS CPU option。用它承接 WSL2、厂商虚拟电器嵌套、CI。
- 不要把 K8s 做成第二套孤岛。 对标 Nutanix dual-native:同一存储/网络/IAM。NKP Metal 说明裸金属 K8s 也要进同一 LCM。
- KVM 开源叙事作为信任补丁,但企业版边界写死(ZSvirt:平台开源、支持收费)。防止 Broadcom 式绑定恐惧。
- Windows 与虚拟电器认证清单单独维护(Cisco UC 已证明应用厂商会自己做 hypervisor)。我方优先拿下数量最多的虚拟电器,而不是自研专用 hypervisor。
- 密度规划: Agent 沙箱按“每会话 100–200MB + 125ms 启动”估 CPU 集群,不要用传统 VM 配比去估 Agent 平台。
出处
- Nutanix dual-native / NKP:https://virtualizationreview.com/articles/2026/08/26/nutanix-expands-cloud-platform-for-production-agentic-ai.aspx
- AWS 嵌套虚拟化 What’s New:https://aws.amazon.com/about-aws/whats-new/2026/02/amazon-ec2-nested-virtualization-on-virtual/
- AWS 用户指南:https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/amazon-ec2-nested-virtualization.html
- InfoQ:https://www.infoq.com/news/2026/03/aws-ec2-nested-virtualization/
- Kata 虚拟化设计:https://kata-containers.github.io/kata-containers/design/virtualization/
- Agent Sandbox + Firecracker:https://agent-sandbox.sigs.k8s.io/docs/use-cases/examples/firecracker-sandbox/
- Firecracker 不嵌套:https://www.pandastack.ai/blog/firecracker-nested-virtualization-explained/
- Xen 5 年支持:https://www.theregister.com/software/2026/03/10/xen-project-announces-five-years-of-support-for-all-releases/5225513
- ZSvirt 开源:抓取
hci-intel/archive/2026-09-03/zstack/why-we-open-sourced-zsvirt-4a700e04.txt
AI 产业链:芯片、光模块、液冷、电力、IDC、模型、应用 —— 对 HCI 需求的含义
日期:2026-09-03
场景定义
HCI 产品规划容易只看 hypervisor 竞品。2026 年真正决定 能否交货、以什么成本交货、客户还能否扩传统集群 的是更长的链:
芯片(GPU/HBM/CPU)→ 光模块 → 交换机 → 液冷 → 电力/变压器 → IDC 土建 → 模型实验室 → 企业应用/Agent。
本卷宗只连“对私有云/HCI 需求的传导”,不做投资推荐。
为何现在重要
- Gartner:为 2027 年按 2025 存储支出的 250%–300% 做预算;约束持续到至少 2028。AI 争硅是主因。Virtualization Review
- Dell:AI 服务器订单/积压创纪录;同时 传统服务器也 +122%——不是“只有 GPU 机柜涨”。Blocks & Files
- Google 调查:91% 领导在选推理硬件时考虑功耗;61% 视为重要因素。德国新 DC 要求 PUE≤1.2 且 10% 废热回用;爱尔兰要求现场可调度发电匹配用电(报告转述法规,实施以当地文本为准)。
- 光模块从 800G 到 1.6T,功耗击穿风冷,液冷从辅料变主料。
2025–2026 动态(按链)
芯片
- NVIDIA 用利润投资生态(MediaTek 35 亿美元可转债 + NVLink Fusion),把自定义 XPU 拉进自家机架。STH
- HBM/DRAM/NAND 同一产线,Handy:短缺时厂商不在乎老客户关系。Nvidia 传 15% 转嫁。Nutanix 展望 FY27 把 服务器供给约束、交期、硬件再涨价 列为保守指引因素。Nutanix 财报转述
- 国产:昇腾超节点、海光 DCU、寒武纪(见
hardware.md)是中国客户的并行链,同样受 HBM/先进封装约束。第三方文称瓶颈已从晶圆转到良率、HBM3e、整机配套——未独立验证数量,当风险提示。
对 HCI: 标准节点(CPU+内存+NVMe)与 GPU 机柜抢同一内存/闪存。报价有效期必须缩短;配置工具要提供“少内存 + 分层”方案。
光模块
- 公开产业报道(2026-08):800G 模块约 15–30W;1.6T DR8 DSP 突破约 40–45W,热流密度 >100W/cm²,超过传统风冷约 50W/cm² 的常被引用上限。液冷渗透:800G 约 5%,1.6T 升至约 40% 的预测(华泰/中信等研报转引,非我方预测)。中际旭创 2026-08-14 入股中石科技(报道称 17.47 亿元、10.47%)被当作绑定散热供应链的信号。新浪财经 OFweek
- Marvell:光学仍比客制芯片更能驱动其 AI 业务(Next Platform 2026-09-02 标题级)。Next Platform
对 HCI: 企业全闪 HCI 仍走 25/100GbE,短期不强制 1.6T。但 AI 旁路集群 一旦进 NVL72/Spectrum-X,光模块与 Cage 液冷会进入机房设计,虚拟化团队不再能只出软件 ISO。
液冷
- ODCC《面向 800G/1.6T 光模块的液冷关键技术白皮书》被行业文引用;Ciena 直插液冷、阿里主导分离式 OSFP Cage 标准(2025-04,报道)成为 2026 讨论点。热设计网
- Cisco–Supermicro:液冷机架与 CDU/冷机“可转售但要额外工程”,不是即插即用。
- Cerebras Nexus 背包冷板:晶圆级 2× 功耗靠包装与冷却,而不是新工艺。
对 HCI: 产品要声明风冷节点与液冷机柜的 管理面是否同一套(功耗、漏液告警、进水口温度)。做不到就不要接 NVL72 项目的总集成。
电力与 IDC
- Dell Clarke:厂商展望 AI 到 2030 占数据中心需求 75%,并加 200GW 电力。数字巨大,当方向信号,不当规划输入。
- Google 报告把爱尔兰/德国能源法规写成选型因素。
- 中国侧:绿电、能耗指标、东数西算与智算中心审批,决定“企业私有 AI 是建在自己园区还是上区域智算”。HCI 在园区侧仍有机会;在 100MW 智算侧机会在管理面/虚拟化多租户,不在三节点超融合。
模型与应用
- 模型侧:开源权重目录战争(Qwen、Gemma、Nemotron、GLM)+ 蒸馏小模型(
small-models.md)。 - 应用侧:Agent 让 Token 与工具调用非线性;安全 Agent 已能触发备份锁定。
- HUMAIN 把对象存储写成国家 AI 栈的记忆层,而不是把 HCI 当核心。
谁在卖什么(链上,非 HCI 本体)
| 环节 | 2026 可见玩家(举例) | HCI 接口 |
|---|---|---|
| GPU/XPU | NVIDIA、AMD、昇腾、海光、寒武纪、Cerebras | 支持矩阵、LCM |
| 光模块/交换 | 中际旭创等模块商;Cisco Silicon One + Spectrum-X;Marvell 光学 | 参考架构网卡/MTU |
| 液冷 | OEM 冷板、Cage、CDU | 监控 API |
| 电力/IDC | 园区 vs 智算中心 | 部署形态分流 |
| 数据 | MinIO、Everpure、备份三巨头 | 数据域放置 |
| 模型 | 开源权重 + NIM + 国产模型 | 模型目录 |
| 应用 | Agent 平台、行业 Copilot | MCP 网关 |
客户要什么 vs 缺口
要什么
- 能交货的配置,而不是最优 FLOPS。
- 电费与 PUE 可汇报。
- 传统业务扩容不被 GPU 项目抽干内存预算。
- 一套运维同时看业务集群与 AI 机柜。
缺口
- HCI 价目表仍按 2024 年 CPU/内存/盘。
- 软件支持周期短于 GPU 代际(18 个月一代卡 vs 5 年虚拟化 LTS)。
- 集成商把液冷/电力风险全部压给软件商——合同上要切开。
对我方产品规划的可执行含义
- 把供应链假设写进产品策略: 2026–2028 内存与闪存贵且紧。功能优先级:内存分层、去重压缩、小模型、KV 卸载,高于“更大内存的金牌节点”。
- SKU 二分: 风冷以太网 HCI(VMware 替代 + 小模型) vs 液冷 AI 机柜管理面。后者可以没有分布式存储。
- 功耗作为一等监控指标(对标 Google 91% 调查),按租户/GPU/机柜出报表,给能耗审计用。
- 版本政策: GPU 驱动与 CUDA/CANN 的支持窗口独立于 hypervisor LTS,避免“升级卡就丢支持”。
- 不要与光模块/电力商争市场。 争的是:在缺货年份,客户仍能用更少 DRAM、更小模型、更好治理把 AI 放进现有机房——这才是 HCI 的增量。
出处
- Gartner 成本与 STaaS:https://virtualizationreview.com/articles/2026/08/27/gartner-hypervisor-replatforming-is-reshaping-enterprise-storage.aspx
- Dell:https://www.blocksandfiles.com/ai-ml/2026/09/02/dells-revenue-bonanza-benefits-from-killer-ai-workloads/5293866
- Nutanix 供给约束:https://www.blocksandfiles.com/hci/2026/08/27/nutanix-grows-despite-hardware-price-rises/5292962
- 光模块液冷:https://finance.sina.com.cn/stock/relnews/cn/2026-08-27/doc-inipthnz9044940.shtml
- OFweek 1.6T 散热:https://fiber.ofweek.com/2026-08/ART-210001-8500-30699108.html
- ODCC 液冷转述:https://resheji.com/xingyezixun/jishuwenzhang/sanrejishu/yelengbanyelenggongzhibeng/2026-04-20/3337.html
- Marvell 光学:https://www.nextplatform.com/connect/2026/09/02/optics-still-driving-marvells-ai-business-more-than-custom-chips/5294018
- MediaTek/NVLink:https://www.servethehome.com/nvidia-and-mediatek-ink-3-5b-investment-deal-accelerate-nvlink-fusion-adoption/
- Google 功耗调查:https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says
2026-09 新兴产业动态(与私有云需求的交界)
日期:2026-09-03
本页只记录 带 2026 URL 的公开动态。不做 TAM。最后一节回答:哪些会变成私有云 / GPU / 边缘 / 数据域订单。
新能源
- 产业叙述把 2026 的新能源从“装机”扩到 车网互动、储能、氢能、电池回收 的系统。储能路线并列锂电、液流、压缩空气、氢储能。部分产业报告给出能量密度/成本数字,口径不一,本页不引用未核验单价。
- 公开报告类文本(2026-07)称 L3 规模化、L4 限定区域运营、固态电池量产等——视为产业媒体主张,规划只用其“场景存在性”。原创力文档转载的《2026年新能源产业创新报告》摘要页
HCI 含义: 电站、充电场站、储能电站是典型 ROBO:2 节点、断网、本地 SCADA VM。另需时序库与对象(巡检视频)。不是 NVL72。
核聚变
- 2026-08-25 上海开幕“2026 核聚变能大会暨核聚变活动周”。科技日报:商业化仍远,三大科学难题是等离子体稳态自持燃烧、高耐辐照材料、燃料自持;中国聚变能源有限公司布局上海/成都,推进中国环流四号,AI 赋能迭代,长三角高温超导联合体。中科院等离子体所:EAST、CRAFT、ITER、BEST。科技日报
- 同会:中国聚变公司总工钟武律强调高温超导与 AI4Fusion。挑战:黑盒控制难直接上装置;失超数据极贵。AI 更适合设计环节。中国聚变发布数字聚变堆协同平台“星聚平台 V1.0”。上海国投等投资“AI+工程”公司原力引擎,算法已上机验证(报道)。网易转载
HCI 含义: 近中期是 科研/工程仿真的 GPU 私有云 + 实验数据域(诊断、仿真、高价值稀缺数据不出所)。控制回路不会上通用 HCI。长期若工程化,现场边缘实时控制需要安全认证运行时(Xen 5 年支持政策正瞄准嵌入式/安全,见 runtime.md),不是超融合卖点。
脑机接口
- 2026-03:博睿康 NEO 获 NMPA 三类证,报道称为全球首款获批上市的植入式脑机接口(硬膜外,手部抓握代偿)。36 例临床(报道)。腾讯新闻/澎湃 虎嗅
- 2026 政策:政府工作报告将脑机接口与量子、具身、6G 并列;NMPA 明确侵入式按三类器械管理(报道称 6 月发分类界定)。
- Neuralink:2026 量产与手术自动化的公开计划;与中国“先拿证、半侵入”路线不同。腾讯新闻评论
- 非侵入:强脑科技等消费/康复产品已规模出货的报道(融资与 FDA/CE 叙述,数字不引用为份额)。
HCI 含义: 医院与实验室要 本地推理 + 强审计数据域(神经信号属最高敏感)。训练可在区域智算,推理与存储必须私有。边缘形态是手术室/康复科室小集群,不是门店 2 节点。合规(等保、医疗器械网络安全)比 IOPS 重要。
机器人 / 具身智能
- 财联社 2026:上半年中国人形机器人出货 已超 4 万台,报道称全球占比进一步升至 97%(媒体数字,未交叉验证)。IT 桔子:2026 上半年具身智能融资 935 亿元,较 2025 上半年升 5 倍(同样为媒体转述)。投资从整机转向大脑/世界模型、真机数据、灵巧手等零部件。落地卡在任务成功率、连续稳定、本体一致性;普遍认为需要百万小时级真机数据。财联社
- NVIDIA Jetson Orin Nano 2(H1 2027)加厚入门边缘 AI,STH 评论认为说明边缘/机器人已大到值得再流一片 Orin。STH
- Xen 项目认真做安全分区,The Register 标题指向“可能给机器人大脑做分区”(抓取页
xen-project-gets-serious-about-safety-in-push-to-possibly-partition-ro,正文曾被污染,仅作线索,安全认证以 Xen 官方为准)。
HCI 含义: 真机数据闭环 = 工厂边缘采集 + 中心 GPU 训练 + 版本化模型下发。百万小时数据是 对象存储 + 数据管道 订单。产线旁 2 节点跑 MES/视觉,与 SmartX 船舶 MES 容器化案例同构。世界模型训练才需要大 GPU;部署在关节/Orin。
创新药
- 脑机接口三类证本身就是创新医疗器械通道的 2026 样本(1 年 7 个月特别审查,虎嗅)。
- 氢能/未来产业政策文本把生物制造、创新药与核聚变、量子并列进“十五五”未来产业篮子(中研网氢能文转述规划,以官方规划文本为准)。中研网
- 药企 AI:发现与临床是 GPU + 敏感数据私有化;生产是 GMP 车间边缘。公开 2026 药政大稿未在本次检索中落到单一权威 URL,故 不编造获批品种数量。规划只保留:创新药研发云 = 私有 GPU + 不可出境的临床/组学数据湖。
HCI 含义: CRO/药企更吃 认证 Hypervisor 多租户 GPU + 对象/湖仓,车间吃 2 节点。备份与审计要能对接临床试验质量管理。
智能驾驶
- 产业技术报告(2026-05)称 L3 进入商业化落地、L4 在港口/矿区/城市快速路示范;激光雷达成本下降、车规 AI 芯片、BEV+Transformer、5G/6G V2X 与边缘计算。原创力文档《2026年新能源产业技术突破报告》
- NVIDIA 汽车合作被 MediaTek 交易稿确认为持续项(Spark 之外的 automotive projects)。
HCI 含义: 车端不是 HCI。需求在 路侧边缘(RSU/MEC 小集群)、园区矿卡调度私有云、车企数据闭环训练(GPU 工厂)。数据域是多模态(视频/点云)对象库,备份窗口与标注流水线是存储设计输入。
能源循环(氢、储能、绿电消纳)
- 中国能源产业发展网 2026 年中盘点:2026 上半年定义为绿氢“规模化商业化元年”;截至 2026-06 国内绿氢项目累计产能 突破 200 万吨/年,较 2025 年底约 +60%(行业媒体)。蒙西部分项目成本逼近煤氢区间的叙述 未独立审计。氢储能:鄂尔多斯 20MW/80MWh、酒泉 50MW 级调峰等报道项目并网;全链效率 42%–45% vs 锂电 85%+,价值在长时/季节。ccedia
- 《新型能源体系建设“十五五”规划》被中研网转述:氢能和绿色燃料纳入非化石能源供给,2030 可再生能源制氢 200 万吨目标——引用时应对原规划文件。中研网
- 电池回收、梯次利用被新能源报告写成闭环(90% 处理率等主张,不采用为事实)。
HCI 含义: 制氢/储能场站 = 工业边缘 + 时序数据 + 视频安防。电氢协同调度是核心侧的 数据平台 + 优化求解(CPU/小 GPU),偶尔才是大模型。安全与生产网隔离优先于 AI。
收束:哪些会创造私有云 / GPU / 边缘 / 数据域需求
| 产业 | 私有云(业务托管) | GPU(训练/大推理) | 边缘(2 节点/ROBO) | 数据域(对象/向量/时序) |
|---|---|---|---|---|
| 新能源电站/储能 | 中(生产管理系统) | 低 | 高 | 时序+视频 |
| 氢能/能源循环 | 中 | 低(优化求解) | 高 场站 | 工艺与碳足迹数据 |
| 核聚变 | 高(研究所云) | 高 仿真/AI4Fusion | 中(装置现场实时,非 HCI) | 高 稀缺实验数据 |
| 脑机接口 | 高 医院/实验室 | 中(解码模型) | 高(科室) | 极高 敏感神经数据 |
| 人形/具身机器人 | 中(工厂 IT) | 高 世界模型/VLA | 高 产线与本体侧 | 极高 百万小时真机数据 |
| 创新药 | 高 研发云 | 高 发现与临床 AI | 中(GMP 车间) | 极高 组学/临床 |
| 智能驾驶 | 中(车企/园区) | 高 数据闭环训练 | 高 路侧/矿区/港口 | 极高 视频点云湖 |
产品映射建议:
- 先抢边缘工业 SKU(新能源场站、工厂机器人、港口矿区):2 节点本地 witness + 可选一张推理卡 + 对象网关。与
edge.md同一 SKU。 - 科研与药企走 AI-Ready 多租户 GPU + 不可变数据域,不要用三节点 HCI 报价。
- 脑机/医疗走合规包(审计、加密、断网),功能可以少,证据链要全。
- 核聚变/智驾训练 是 GPU 工厂 + 专用存储,HCI 只做控制面与非加速业务。
- 以上产业的共同增量不是“再卖一个虚拟化特性”,而是 数据不出域的闭环:采集在边缘,训练在私有 GPU,下发回边缘。这把
edge.md、data-domain.md、ai-ready.md焊成一条行业方案。
出处(均为 2026 URL)
- 核聚变大会:https://www.stdaily.com/web/gdxw/2026-08/26/content_569761.html
- AI+聚变:https://www.163.com/dy/article/L5JD2VM3055040N3.html?clickfrom=w_tech
- 博睿康 NEO 获批:https://news.qq.com/rain/a/20260313A04L6M00
- 脑机“中国时刻”:https://www.huxiu.com/article/4881820.html
- 中美脑机竞赛:https://news.qq.com/rain/a/20260402A01KJS00
- 人形机器人出货:https://m.cls.cn/detail/2461593
- Jetson Orin Nano 2:https://www.servethehome.com/nvidia-announces-jetson-orin-nano-2-entry-level-edge-board-gets-new-ampere-silicon/
- 绿氢年中盘点:https://www.ccedia.com/finance_detail/20766.html
- 氢能产业链:https://www.chinairn.com/scfx/20260901/180155502.shtml
- 新能源产业创新报告转载:https://max.book118.com/html/2026/0704/7013125036011130.shtm
- 新能源技术突破报告转载:https://max.book118.com/html/2026/0502/8036132025010067.shtm