深色模式
私有化部署方案总览
摘要:私有化不是"把模型下载下来跑起来",而是一套涉及算力测算、网络隔离、模型合规、运维体系的工程决策。本文给出:私有化的适用判断(什么时候该私有化、什么时候用 API 更划算)、显存与算力测算方法、部署形态选型、推理引擎选型,以及国产化适配的路线图。前置阅读:LLM 推理服务架构总览、vLLM 部署。
该不该私有化:先算账再决策
| 决策因素 | 倾向私有化 | 倾向 API |
|---|---|---|
| 数据合规 | 强敏感/涉密/数据不出域 | 一般敏感,协议可约束 |
| 流量规模 | 稳定高流量(摊薄 GPU 成本) | 波动大、长尾流量 |
| 时效要求 | 长期使用(>1 年) | 短期验证 |
| 团队能力 | 有 GPU 运维与推理调优经验 | 无专职平台团队 |
| 迭代速度 | 模型版本可锁定 | 需要紧跟前沿模型 |
经验法则:日均 token 量级到达数亿且数据敏感度中高时,私有化的 TCO 开始优于头部旗舰模型 API;低流量场景私有化通常只是买了个"数据安心",算力利用率极低。成本测算方法见 GPU 成本模型与计费。
显存与算力测算
私有化方案的第一道数学题:
text
模型权重显存 ≈ 参数量 × 每参数字节数
FP16/BF16: 2 字节/参数 → 7B 模型 ≈ 14 GB
INT8: 1 字节/参数 → 7B 模型 ≈ 7 GB
INT4/GPTQ: 0.5 字节/参数 → 7B 模型 ≈ 3.5 GB
KV Cache 显存 ≈ 2 × 层数 × KV头数 × 头维度 × 精度字节 × 上下文长度 × 并发数
(7B 级模型、8K 上下文、单并发约 0.5~1 GB,随架构差异浮动)1
2
3
4
5
6
7
2
3
4
5
6
7
实际配置 = 权重 + KV Cache(按目标并发与上下文长度)+ 激活值余量(约 10%~20%)。量化基础见 模型量化基础,KV Cache 优化见 KV Cache 与显存优化。
待验证
KV Cache 公式随模型架构(GQA/MLA 等)差异很大,上表为 MHA 简化口径;具体模型请用其官方 README 或 vLLM 的显存自检日志校准。
部署形态选型
| 形态 | 适用 | 要点 |
|---|---|---|
| 单机容器(Docker Compose) | POC、单团队内部工具 | 最快上线,无高可用 |
| K8s + GPU 调度 | 生产标配 | 需 GPU Operator、设备插件、节点池隔离 |
| K8s + KServe/vLLM 生产级 | 多模型共享算力 | 弹性伸缩、金丝雀发布(见 KServe 实战) |
| 裸机 + systemd | 极致性能、运维能力弱于容器场景 | 排障直接,但升级/回滚麻烦 |
K8s 路线的落地清单(与 GPU 资源池化与调度 衔接):NVIDIA GPU Operator 驱动与容器运行时、nvidia.com/gpu 资源配额、按型号打节点标签与污点、Prometheus DCGM Exporter 监控 GPU。
推理引擎选型
| 引擎 | 定位 | 适用 |
|---|---|---|
| vLLM | 通用默认选择,PagedAttention、生态最全 | 绝大多数在线服务 |
| SGLang | 高吞吐、RadixAttention 前缀缓存 | 多轮对话/高频共享前缀 |
| TGI | Hugging Face 生态集成 | HF 模型为主的团队 |
| TensorRT-LLM | NVIDIA 深度优化,极致性能 | 固定模型、追求极限吞吐 |
| Ollama / llama.cpp | 单机轻量、GGUF | 边缘、开发机、小规模 |
对比细节见 TGI / SGLang 推理引擎对比。私有化特有考量:离线安装——生产网通常隔离,需提前在内网制品库(Harbor 镜像仓库、内部 PyPI/模型仓库)备齐镜像与权重,权重分发与版本管理见 私有化模型仓库与镜像。
国产化适配路线
信创场景的适配分层(从易到难):
- 模型层:选用国产开源模型(Qwen / DeepSeek / GLM 等),生态与工具链兼容性最好;
- 推理引擎层:vLLM 等社区引擎已适配昇腾(Ascend)等国产芯片后端;vLLM-Ascend 等项目由社区与厂商共同维护,版本兼容矩阵需逐一确认;
- 芯片层:昇腾 NPU 走 CANN 工具链,其余国产 GPU 各有专有运行时——显存测算公式通用,但算子覆盖度决定"能不能跑"与"跑多快",必须 PoC 实测目标模型的吞吐与精度;
- 框架层:LangChain/LlamaIndex 等上层框架与 OpenAI 兼容接口对接,通常无需改造。
[厂商/版本相关]:国产芯片的模型支持列表与性能数据迭代极快,选型前以厂商最新适配列表为准,并以自建评测集跑分,不采信单一宣传口径。