敢用 AI:企业 AI 本地化部署培训第二章 · 部署与成本
第二章 · 企业AI本地部署
第二章
企业AI本地部署
三种形态、成本账、参考架构 —— 怎么选、怎么部、花多少钱
第二章 · 企业AI本地部署

「本地部署」的三种形态

第二章回答三个问题:怎么选、怎么部、花多少钱

本页结论:「本地部署」混着三件成本差一个数量级的事 —— 先说清要哪一种,再谈钱。
第二章 · 企业AI本地部署

「本地部署」到底指哪一种

说法实际含义代价
模型本地推理在自己的 GPU 上跑,不出网要买卡、要养人;模型能力通常落后云端一档
数据本地、模型在云希望「数据不走,只走问题」多数情况做不到 —— 提示词里必然带业务数据,那就是数据出域
全链路内网模型 + 编排 + 数据 + 审计全在机房最贵,但也是唯一能对监管交代的形态
!
第二种是最常见的误解。只要提示词里带了业务数据,「数据没出去」这句话就站不住。这一条不先分清楚,后面所有讨论都会跑偏。
第二章 · 企业AI本地部署

云端 API vs 全链路内网

维度云端 API全链路内网
数据出域出 —— 提示词里必然带业务数据不出
成本结构按量付费,轻资产起步一次性投入 + 长期运维
模型能力永远是最新旗舰通常落后云端一档
对监管交代难 —— 数据出了门就说不清 —— 全链路留痕在自己手里
适合数据不敏感的提效场景强监管、数据敏感的核心场景
这不是「哪个更好」的问题,是按数据敏感度分流的问题 —— 多数企业最终是两条腿走路。
第二章 · 企业AI本地部署

硬件与成本账

显存 ≈ 模型权重(参数量 × 精度)+ KV 缓存(随并发和上下文长度线性上涨)+ 富余。三个变量定成本,不是拍脑袋。
模型量级量化后显存(INT4 量级)典型硬件投入量级能干什么
7 – 14B约 5 – 10 GB单张 24G 消费级卡数万元问答、摘要、分类;复杂推理别指望
32B 级约 18 – 24 GB单张 48G,或 2 × 24G十万元级多数企业知识库与审查场景的甜点位
70B 级约 40 – 48 GB2 × 48G,或 4 × 24G数十万元接近云端上一代旗舰的通用能力
满血 600B+400 GB 以上单机 8 卡起步数百万元级对标云端旗舰;多数企业不必一步到位

量级估算,用于立项讨论;实际以目标模型、上下文长度、并发画像实测为准。同等预算下,把钱花在「场景匹配的中档模型 + 好的检索」,通常胜过硬上大模型

2026 年生产共识为什么
推理引擎vLLM / SGLang 一类高并发引擎OpenAI 兼容接口,生态最成熟;单机聊天工具撑不住生产并发
量化新硬件走 FP8;显存吃紧用 AWQ / GPTQ INT4能力损失可控,显存近乎减半
网关LiteLLM 一类统一网关入口收口:限流、计费、审计留痕都在这一层
知识库(RAG)连接器 → 解析 → 向量化 → 重排 → 生成权限继承与评测是必备件,不是可选项
第二章 · 企业AI本地部署

参考架构

一套能对监管交代的内网栈,横着看四层、竖着看两条贯穿线:

① 统一网关唯一入口:认证、限流、用量计费、调用留痕 —— 审计从这里开始
② 编排与知识库agent 运行时、RAG 检索、工具调用、人工复核卡点
③ 模型服务推理引擎 + 量化模型,OpenAI 兼容端点,可多模型并存
④ 算力与数据GPU、向量库、对象存储、业务数据源 —— 全部在内网
贯穿:权限与审计每一层都有身份与授权;决策链全程可回放
贯穿:可观测性延迟、命中率、拒答率、异常告警 —— 验收和运维都靠它

对标:NVIDIA《Enterprise AI Factory Design Guide》(2026-05)将网关、安全、可观测性列为一级构件 —— 上述分层与之对应。

第二章 · 企业AI本地部署

本章内容

七个评价维度,加一张对照表。
决策树:四个分叉,三种典型选法。
分三步,每步都有验收;以及四类必须管住的风险。

材料更新于 2026-09-09,内容随课程迭代持续演进。