0%

数据分级与出域管控

数据分级与出域管控

一句话定位:所有 AI 数据安全治理的起点。不先定义”什么数据算机密、哪一级能出域”,后面的网关、脱敏、合同全都无处发力——分级是策略,其余都是执行

1. 四级分类与出域策略

级别 示例 允许的出口
公开 已发布文档、官网内容 任意公有 API
内部 内部流程、通用技术文档 企业版 API(须签零保留)
秘密 经营数据、非公开设计方案 仅私有化部署 / VPC 独占实例
机密 核心源码、客户名单、未披露财务、算法参数、密钥 禁止出域,仅内网自部署模型

关键动作:把分级结果落成机器可判定的规则(正则、关键词库、数据表/字段标签、文档标签),而不是停留在制度文档里——否则网关无法自动执行。

2. 按数据分级做模型路由(最具性价比的架构决策)

这是核心设计:不是”全部私有化”或”全部走 API”的二选一,而是按级别分流

  • 机密/秘密 → 强制路由到内网自部署模型(vLLM/SGLang 承载,见 9.6);
  • 内部 → 企业版公有 API(已签零保留与不用于训练);
  • 公开 → 任意可用模型,优先按成本与效果选。

收益:把昂贵的私有化算力只用在真正需要的流量上,其余享受公有模型的效果与成本优势。路由决策点统一收敛在 LLM Gateway(见 9.2)。

3. 红线清单(必须显式列举)

制度上要有一份不可协商的禁止清单,至少包括:

  • 核心业务源码与算法参数;
  • 客户名单、合同条款、报价体系;
  • 未披露财务数据、并购与战略计划;
  • 任何凭证类信息(密钥、token、账号密码);
  • 个人敏感信息(身份证、银行卡、医疗记录)。

4. 网络层兜底:防止”影子 AI”

制度与网关都可能被绕过(员工直接用浏览器或个人 Key 调外部服务),因此需要出口网络管控

  • 防火墙/代理阻断公网 AI 服务域名,仅放行内部 LLM Gateway
  • 终端侧管控(DLP 客户端)监测剪贴板与文件上传行为。

配套原则:必须提供好用的内部合规替代工具。只封禁不供给,必然催生影子 AI,反而让数据流向完全失控——这是治理成败的关键。

参考:《信息安全技术 网络安全等级保护基本要求》(GB/T 22239);NIST AI Risk Management Framework;ISO/IEC 27001 信息分类控制项