第二章 · 企业AI本地部署
第二章
企业AI本地部署
三种形态、成本账、参考架构 —— 怎么选、怎么部、花多少钱
第二章 · 企业AI本地部署
「本地部署」的三种形态
第二章回答三个问题:怎么选、怎么部、花多少钱。
本页结论:「本地部署」混着三件成本差一个数量级的事 —— 先说清要哪一种,再谈钱。
第二章 · 企业AI本地部署
「本地部署」到底指哪一种
| 说法 | 实际含义 | 代价 |
|---|---|---|
| 模型本地 | 推理在自己的 GPU 上跑,不出网 | 要买卡、要养人;模型能力通常落后云端一档 |
| 数据本地、模型在云 | 希望「数据不走,只走问题」 | 多数情况做不到 —— 提示词里必然带业务数据,那就是数据出域 |
| 全链路内网 | 模型 + 编排 + 数据 + 审计全在机房 | 最贵,但也是唯一能对监管交代的形态 |
!
第二种是最常见的误解。只要提示词里带了业务数据,「数据没出去」这句话就站不住。这一条不先分清楚,后面所有讨论都会跑偏。
第二章 · 企业AI本地部署
云端 API vs 全链路内网
| 维度 | 云端 API | 全链路内网 |
|---|---|---|
| 数据出域 | 出 —— 提示词里必然带业务数据 | 不出 |
| 成本结构 | 按量付费,轻资产起步 | 一次性投入 + 长期运维 |
| 模型能力 | 永远是最新旗舰 | 通常落后云端一档 |
| 对监管交代 | 难 —— 数据出了门就说不清 | 能 —— 全链路留痕在自己手里 |
| 适合 | 数据不敏感的提效场景 | 强监管、数据敏感的核心场景 |
这不是「哪个更好」的问题,是按数据敏感度分流的问题 —— 多数企业最终是两条腿走路。
第二章 · 企业AI本地部署
硬件与成本账
显存 ≈ 模型权重(参数量 × 精度)+ KV 缓存(随并发和上下文长度线性上涨)+ 富余。三个变量定成本,不是拍脑袋。
| 模型量级 | 量化后显存(INT4 量级) | 典型硬件 | 投入量级 | 能干什么 |
|---|---|---|---|---|
| 7 – 14B | 约 5 – 10 GB | 单张 24G 消费级卡 | 数万元 | 问答、摘要、分类;复杂推理别指望 |
| 32B 级 | 约 18 – 24 GB | 单张 48G,或 2 × 24G | 十万元级 | 多数企业知识库与审查场景的甜点位 |
| 70B 级 | 约 40 – 48 GB | 2 × 48G,或 4 × 24G | 数十万元 | 接近云端上一代旗舰的通用能力 |
| 满血 600B+ | 400 GB 以上 | 单机 8 卡起步 | 数百万元级 | 对标云端旗舰;多数企业不必一步到位 |
量级估算,用于立项讨论;实际以目标模型、上下文长度、并发画像实测为准。同等预算下,把钱花在「场景匹配的中档模型 + 好的检索」,通常胜过硬上大模型。
| 层 | 2026 年生产共识 | 为什么 |
|---|---|---|
| 推理引擎 | vLLM / SGLang 一类高并发引擎 | OpenAI 兼容接口,生态最成熟;单机聊天工具撑不住生产并发 |
| 量化 | 新硬件走 FP8;显存吃紧用 AWQ / GPTQ INT4 | 能力损失可控,显存近乎减半 |
| 网关 | LiteLLM 一类统一网关 | 入口收口:限流、计费、审计留痕都在这一层 |
| 知识库(RAG) | 连接器 → 解析 → 向量化 → 重排 → 生成 | 权限继承与评测是必备件,不是可选项 |
第二章 · 企业AI本地部署
参考架构
一套能对监管交代的内网栈,横着看四层、竖着看两条贯穿线:
① 统一网关唯一入口:认证、限流、用量计费、调用留痕 —— 审计从这里开始
② 编排与知识库agent 运行时、RAG 检索、工具调用、人工复核卡点
③ 模型服务推理引擎 + 量化模型,OpenAI 兼容端点,可多模型并存
④ 算力与数据GPU、向量库、对象存储、业务数据源 —— 全部在内网
贯穿:权限与审计每一层都有身份与授权;决策链全程可回放
贯穿:可观测性延迟、命中率、拒答率、异常告警 —— 验收和运维都靠它
对标:NVIDIA《Enterprise AI Factory Design Guide》(2026-05)将网关、安全、可观测性列为一级构件 —— 上述分层与之对应。
第二章 · 企业AI本地部署
本章内容
材料更新于 2026-09-09,内容随课程迭代持续演进。