# 小模型(7B–32B):蒸馏、Embedding 与分支 GPU 日期:2026-09-03 ## 场景定义 本卷宗的“小模型”不是科研玩具,而是企业私有云上 **可单卡或小集群生产服役** 的模型档: - **7B–14B**:默认生产学生模型;适合分类、摘要、工单、内部 Copilot、工具调用。 - **14B–32B**:推理/复杂 RAG 的“单机甜区”;4bit 量化后可进 24–48GB 卡。 - **蒸馏(distill)**:用前沿教师模型生成任务数据,微调小学生模型,换 Token 成本与数据不出域。 - **Embedding / 重排**:768–1536 维向量,RAG 的刚需,CPU 或小 GPU 即可,但存储与 QPS 敏感。 - **分支 GPU**:数据中心边缘、工厂、门店、地市节点上的 1–4 卡,不是 NVL72。 与大模型卷宗的边界:训练 70B+、多机并行、GB200 NVL72、AI Factory 见 `large-models.md`。本卷宗回答 **VMware 替代完成后,第一波可售的 AI 能力是什么**。 ## 为何现在重要 - **生产推理在回流私有云。** Broadcom 在 VMware Explore 2026 引用其 6 月对 1800 名 IT 决策者的调查(**厂商调查**):56% 已在或计划在私有云跑生产推理;62% 担心成本;51% 因安全把 AI 工作负载迁回;公有云用于此类负载同比降 15 个百分点到 41%。[Next Platform](https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559) - **Agent 让 Token 变成非线性。** Google Cloud《2026 State of infrastructure in the agentic AI era》:83% 受访组织认为现有基础设施需要某种升级才能支撑生产级 Agent;一次 Agent 提示可触发数百下游动作。小模型是把这些动作留在内网、可控成本的手段。[Virtualization Review](https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says) - **HCI 厂商已把 <8B 写成 GA,>100B 仍预览。** Nutanix Enterprise AI 2.8(2026-08-26 GA):Private Inference 支持 **<80 亿参数微调**;>1000 亿参数的多节点/多 GPU 推理仍是 **技术预览,厂商明确禁止生产使用**;KV Cache 从 GPU 卸到 CPU 内存也是预览。[Virtualization Review / Nutanix](https://virtualizationreview.com/articles/2026/08/26/nutanix-expands-cloud-platform-for-production-agentic-ai.aspx) - **边缘明确需要本地 SLM。** 同份 Google 报告:90% 认为在边缘部署生成式模型重要。NVIDIA 用新 Orin Nano 2(H1 2027 上市)加厚入门边缘 AI,说明分支侧不是被放弃的市场。[STH](https://www.servethehome.com/nvidia-announces-jetson-orin-nano-2-entry-level-edge-board-gets-new-ampere-silicon/) 对中国规划:信创机房很难拿到 NVL72 配额,但 7B–32B + 国产卡/MIG 是可以交付的。VMware 替代项目若只交“能跑 VM”,会在第二年被“模型服务平台”标书分流。 ## 2025–2026 动态 ### 蒸馏成为企业默认降本手法 公开技术讨论(2026 中)把生产蒸馏的学生模型默认放在 **7B–14B**:Qwen 3 8B 常被当作默认学生(单 A10/L4);Gemma 4 12B 用作推理更重的任务;32B 蒸馏(如 DeepSeek-R1-Distill-Qwen-32B)在 4bit 后约 20GB,可进单张 L40/A100。**这些是模型卡与工程博客的硬件经验,不是基准排名,POC 必须用自己的任务集复测。** 参考: - 生产蒸馏流程概述:https://aitechconnect.in/tips/llm-distillation-teacher-student-production-2026 - R1 蒸馏档位与显存经验:https://willitrunai.com/blog/deepseek-r1-vram-requirements-guide - 32B GPTQ 4bit ~20GB、单 L40:https://huggingface.co/empirischtech/DeepSeek-R1-Distill-Qwen-32B-gptq-4bit VMware AI Factory **厂商自称** 已可运行 150+ 开源/商用模型,并加入 Nemotron 3、Gemma 4、Qwen 3.7-Max、GLM 5.2 等——说明目录战的入场券是“开源权重 + 国产/开源家族”,不是只绑一个闭源 API。[Next Platform](https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559) ### Embedding 把 HCI 变成向量存储问题 Qdrant 2026-09-01 发布 FineWeb-10B:100 亿文档、24.47 TB 向量、28.66 TB 原文与元数据(**厂商数据集声明**)。结论不是“每家都要 100 亿向量”,而是:评测集已经大到让“内存里放得下”的假设破产,磁盘路径、压缩、召回@k 必须进产品能力。[Blocks & Files](https://www.blocksandfiles.com/ai-ml/2026/09/01/it-aint-big-enough-qdrant-uprates-vector-benchmark-dataset-size-1000x/5293826) SmartX 在榫卯超融合上测 Qdrant v1.18.2(Cohere 1M/10M × 768 维):**厂商自称** 性能达到或超过 QdrantCloud 官方基准;16GB 内存 + 向量压缩 + rescore,可承载约 31GB 工作集的千万级向量,570+ QPS、0.93+ 召回。这是厂商实验,硬件为 Xeon Gold 5218R + NVMe 缓存 + HDD,**不能外推为通用 SLA**。但它证明:中型 HCI 全闪/分层集群 **可以** 把 embedding 检索当生产负载,而不是必须外置专用向量一体机。[SmartX 博客](https://www.smartx.com/)(抓取页:`hci-intel/archive/2026-09-03/smartx/ai实践-超融合支持qdrant向量数据库的性能验证与调优实践-b200e2b7.txt`) MLPerf Storage v3.0 把向量库(Milvus,100 万向量 × 1536 维)列为正式负载,与训练、checkpoint、KV Cache 并列。说明标准组织已把 embedding 检索当成存储产品必须回答的问题。[Blocks & Files](https://www.blocksandfiles.com/ai-ml/2026/09/01/mlperf-storage-benchmark-updated-for-modern-ai/5293617) ### 分支 GPU:小模型的物理落点 - 数据中心“分支”:1–8 张 L40S/L4/国产推理卡,与业务 VM 同集群或独立小集群。Nutanix 把 fine-tune <8B 放在现有 NCP 上,明确“不要为 AI 重建业务系统”(Cornely,**厂商表态**)。 - 站点边缘:Jetson Orin Nano 2,厂商称较上代 Nano 实得性能约 2× 或同性能降耗约 40%,H1 2027 出货。面向机器人、无人机、视觉,不是机房 GPU。 - 中国分支:昇腾推理卡、寒武纪 MLU、海光 DCU 更常出现在“行业小模型 + 信创主机”标书,而不是 NVL72(见 `hardware.md`)。 Token 成本优化也在小模型路径上出现:Jedify 等上下文图工具宣称可降 75% Token(**厂商自称,2026-08-27**),说明应用层会继续压缩提示,基础设施侧不能只按“上下文越长越好”规划显存。[Blocks & Files](https://www.blocksandfiles.com/ai-ml/2026/08/27/context-grapher-jedify-cuts-ai-token-costs-75-percent/5293003) ## 谁在卖什么 | 厂商 | 产品 | 小模型相关能力 | 备注 | | --- | --- | --- | --- | | Nutanix | Enterprise AI 2.8 / Agent Gateway / Private Inference | <8B 微调 GA;NIM 断网部署;MCP 治理;>100B 多节点预览 | 双原生,强调不重建业务系统 | | Broadcom VMware | Private AI Cloud / AI Factory / Tanzu | 150+ 模型目录(厂商自称);SLM+LLM;租户隔离 nameplate;安全沙箱 | 绑 VCF 9 | | Red Hat | OpenShift AI + vLLM / llm-d | 分布式推理;MCP Catalog 开发者预览 | AgentOps 框架,见 agent-ready | | SmartX | 榫卯 AI 平台 + SMTX OS | 算力/模型/网关;Qdrant 同集群验证(厂商实验) | 路径:先云底座再模型再 Agent | | ZStack | Zentrix | 统一模型接入、Token 账、Agent 调用拦截 | 从分散 API Key 到治理 | | NVIDIA | NIM、NVAIE、Jetson | 小模型微服务 + 边缘模组 | 认证矩阵决定谁能卖“AI ready” | | 开源权重 | Qwen / Gemma / DeepSeek 蒸馏 / Nemotron | 7B–32B 学生模型 | 目录必须可更新,不要写死版本 | ## 客户要什么 vs 缺口 **要什么** - 数据不出域的内部问答、代码助手、单据抽取。 - 按部门/租户的模型目录与 API Key,而不是每人一张公有云 Key。 - 单卡就能上线,不要先批一个 AI 机房。 - Embedding 与业务文件同机房,延迟稳定。 - 国产卡或 MIG 切片,避免一张 H100 被一个试点占死。 **缺口** - 多数 HCI 只有“GPU 透传给一台 VM”,没有模型网关、量化策略、KV 卸载、多 LoRA。 - 向量库与超融合的 NUMA、RDMA、副本策略缺乏官方支持矩阵(SmartX 是少数公开测过的,仍是厂商实验)。 - 蒸馏流水线(教师调用、数据过滤、学生训练、回归评测)没有产品化,停留在数据团队笔记本。 - 分支站点缺 2 节点 + 1 张推理卡的参考架构(与 `edge.md` 交界)。 ## 对我方产品规划的可执行含义 1. **把“模型即服务(7B–32B)”做成 VMware 替代标书的标准可选包**,不要等大模型项目。最小集:vLLM/NIM 等价 serving、量化(AWQ/GPTQ/INT8)、租户 Token 配额、审计日志。 2. **官方支持三种 GPU 切片**:整卡透传(32B)、MIG/vGPU(7B–14B 多租户)、CPU/NPU embedding。Nutanix 把 >100B 标成预览是正确的产品诚实:先把能 GA 的做硬。 3. **Embedding 作为存储场景进 HCI 性能验收**,不要只跑 FIO。至少覆盖:768 维千万向量、磁盘优先 + 压缩、召回与 P95。对标 Qdrant/Milvus,而不是“AI 就绪”口号。 4. **蒸馏不是训练集群需求。** 规划文档写清:教师可在公有云或隔离区,学生在生产 HCI 上 QLoRA;避免把小模型项目做成千卡采购。 5. **分支 SKU**:2–3 节点 HCI + 1 张 24–48GB 卡 + 本地向量盘,作为地市/工厂标准件。与 NVL72 方案分目录报价。 6. **模型目录中立。** 必须同时列 Qwen、Gemma、DeepSeek 蒸馏、国产卡可用的对应权重;VMware 已经在目录里加 Qwen 与 GLM,国内招标会逐项对表。 ## 出处 - VMware Private AI Cloud / 调查数字:https://www.nextplatform.com/cloud/2026/09/01/vmware-intros-private-ai-cloud-ai-factory-as-workloads-shift-to-on-prem/5293559 - Google agentic 基础设施报告:https://virtualizationreview.com/articles/2026/08/28/agentic-ai-pushes-enterprise-infrastructure-toward-an-upgrade-cycle-google-report-says - Nutanix NAI 2.8:https://virtualizationreview.com/articles/2026/08/26/nutanix-expands-cloud-platform-for-production-agentic-ai.aspx - Nutanix 新闻稿:https://www.nutanix.com/press-releases/2026/nutanix-gives-enterprises-the-freedom-to-run-production-agentic-ai-their-way - Qdrant 10B:https://www.blocksandfiles.com/ai-ml/2026/09/01/it-aint-big-enough-qdrant-uprates-vector-benchmark-dataset-size-1000x/5293826 - MLPerf Storage v3.0:https://www.blocksandfiles.com/ai-ml/2026/09/01/mlperf-storage-benchmark-updated-for-modern-ai/5293617 - Jetson Orin Nano 2:https://www.servethehome.com/nvidia-announces-jetson-orin-nano-2-entry-level-edge-board-gets-new-ampere-silicon/ - SmartX Qdrant 实验:本地抓取 `hci-intel/archive/2026-09-03/smartx/ai实践-超融合支持qdrant向量数据库的性能验证与调优实践-b200e2b7.txt`