私有化部署选型与落地优先级
一句话定位:让数据根本不出域是最彻底的方案。本节给出三种部署形态的取舍,以及一条从零到合规的落地优先级路径。
1. 三种形态对比
| 方案 | 安全性 | 代价 | 适用 |
|---|---|---|---|
| 私有化部署开源模型(vLLM / SGLang + Qwen / DeepSeek / Llama 等) | 最高:数据完全不出内网 | 需自建 GPU 集群与推理运维;顶级效果略逊闭源旗舰 | 机密级数据、高频稳定负载 |
| VPC 独占 / 专有云实例 | 高:逻辑隔离、不与他人共享实例 | 成本高;仍依赖厂商的隔离与承诺 | 秘密级数据、想用闭源效果 |
| 公有 API + 治理(网关 + 脱敏 + 合同) | 依赖技术管控与合同 | 最低成本、最好效果、无运维 | 公开/内部级数据 |
关键结论:不是三选一,而是按数据分级组合使用(见 9.1 的模型路由)——机密走私有化,内部走公有企业版,由网关统一决策。
2. 私有化部署的工程要点
- 推理引擎选型:高并发通用服务 → vLLM(PagedAttention + Continuous Batching,见 3.5/3.6);前缀重复率高的 Agent/结构化抽取 → SGLang(RadixAttention,见 3.9);配置稳定追求极致性能 → TensorRT-LLM(见 3.8);
- 成本控制:私有化的主要成本是 GPU。用量化(第 4 章)降低显存与卡数需求,是让私有化方案在经济上可行的关键手段——INT4 可让大模型单卡部署;
- 容量规划:KV Cache 决定并发上限(见 3.4),需按峰值并发与上下文长度反推显存与卡数;
- 模型能力差距的弥补:用 RAG 补知识(第 8 章)、用微调补领域能力、用小模型+蒸馏(见 4.5)控成本,多数内部场景无需旗舰模型。
3. 落地优先级(从零到合规的推荐顺序)
按”投入产出比”排序,前两步几乎无技术成本却收益最大:
- 数据分级 + 红线清单(制度先行,无需技术投入,见 9.1);
- LLM Gateway 统一出口 + 审计日志 + 出口网络阻断(见 9.2)——这是整个体系的骨架;
- 签零保留 / 不用于训练条款,把默认渠道从个人版换成企业版(见 9.4);
- 网关加 DLP 扫描与脱敏回填(见 9.2 / 9.3);
- 私有化部署承接机密级流量(本节);
- 持续验证:Canary 探针(见 9.4)+ RAG 权限过滤复核(见 9.5)+ 定期红队演练。
4. 常见误区
- 一上来就要求全部私有化 → 成本失控且效果倒退,业务方会绕过(影子 AI);
- 只签合同不做技术管控 → 合同只能事后追责(见 9.4);
- 忽略 embedding 接口 → 向量化同样把原文送出域(见 9.2);
- 忘记内部越权 → 对外防住了,却在 RAG 里对内泄漏(见 9.5)。
参考:vLLM / SGLang / TensorRT-LLM 官方部署文档;NIST AI Risk Management Framework