0%

私有化部署选型与落地优先级

私有化部署选型与落地优先级

一句话定位:让数据根本不出域是最彻底的方案。本节给出三种部署形态的取舍,以及一条从零到合规的落地优先级路径。

1. 三种形态对比

方案 安全性 代价 适用
私有化部署开源模型(vLLM / SGLang + Qwen / DeepSeek / Llama 等) 最高:数据完全不出内网 需自建 GPU 集群与推理运维;顶级效果略逊闭源旗舰 机密级数据、高频稳定负载
VPC 独占 / 专有云实例 高:逻辑隔离、不与他人共享实例 成本高;仍依赖厂商的隔离与承诺 秘密级数据、想用闭源效果
公有 API + 治理(网关 + 脱敏 + 合同) 依赖技术管控与合同 最低成本、最好效果、无运维 公开/内部级数据

关键结论:不是三选一,而是按数据分级组合使用(见 9.1 的模型路由)——机密走私有化,内部走公有企业版,由网关统一决策。

2. 私有化部署的工程要点

  • 推理引擎选型:高并发通用服务 → vLLM(PagedAttention + Continuous Batching,见 3.5/3.6);前缀重复率高的 Agent/结构化抽取 → SGLang(RadixAttention,见 3.9);配置稳定追求极致性能 → TensorRT-LLM(见 3.8);
  • 成本控制:私有化的主要成本是 GPU。用量化(第 4 章)降低显存与卡数需求,是让私有化方案在经济上可行的关键手段——INT4 可让大模型单卡部署;
  • 容量规划:KV Cache 决定并发上限(见 3.4),需按峰值并发与上下文长度反推显存与卡数;
  • 模型能力差距的弥补:用 RAG 补知识(第 8 章)、用微调补领域能力、用小模型+蒸馏(见 4.5)控成本,多数内部场景无需旗舰模型。

3. 落地优先级(从零到合规的推荐顺序)

按”投入产出比”排序,前两步几乎无技术成本却收益最大:

  1. 数据分级 + 红线清单(制度先行,无需技术投入,见 9.1);
  2. LLM Gateway 统一出口 + 审计日志 + 出口网络阻断(见 9.2)——这是整个体系的骨架;
  3. 签零保留 / 不用于训练条款,把默认渠道从个人版换成企业版(见 9.4);
  4. 网关加 DLP 扫描与脱敏回填(见 9.2 / 9.3);
  5. 私有化部署承接机密级流量(本节);
  6. 持续验证:Canary 探针(见 9.4)+ RAG 权限过滤复核(见 9.5)+ 定期红队演练。

4. 常见误区

  • 一上来就要求全部私有化 → 成本失控且效果倒退,业务方会绕过(影子 AI);
  • 只签合同不做技术管控 → 合同只能事后追责(见 9.4);
  • 忽略 embedding 接口 → 向量化同样把原文送出域(见 9.2);
  • 忘记内部越权 → 对外防住了,却在 RAG 里对内泄漏(见 9.5)。

参考:vLLM / SGLang / TensorRT-LLM 官方部署文档;NIST AI Risk Management Framework