数据分级与出域管控
一句话定位:所有 AI 数据安全治理的起点。不先定义”什么数据算机密、哪一级能出域”,后面的网关、脱敏、合同全都无处发力——分级是策略,其余都是执行。
1. 四级分类与出域策略
| 级别 | 示例 | 允许的出口 |
|---|---|---|
| 公开 | 已发布文档、官网内容 | 任意公有 API |
| 内部 | 内部流程、通用技术文档 | 企业版 API(须签零保留) |
| 秘密 | 经营数据、非公开设计方案 | 仅私有化部署 / VPC 独占实例 |
| 机密 | 核心源码、客户名单、未披露财务、算法参数、密钥 | 禁止出域,仅内网自部署模型 |
关键动作:把分级结果落成机器可判定的规则(正则、关键词库、数据表/字段标签、文档标签),而不是停留在制度文档里——否则网关无法自动执行。
2. 按数据分级做模型路由(最具性价比的架构决策)
这是核心设计:不是”全部私有化”或”全部走 API”的二选一,而是按级别分流。
- 机密/秘密 → 强制路由到内网自部署模型(vLLM/SGLang 承载,见 9.6);
- 内部 → 企业版公有 API(已签零保留与不用于训练);
- 公开 → 任意可用模型,优先按成本与效果选。
收益:把昂贵的私有化算力只用在真正需要的流量上,其余享受公有模型的效果与成本优势。路由决策点统一收敛在 LLM Gateway(见 9.2)。
3. 红线清单(必须显式列举)
制度上要有一份不可协商的禁止清单,至少包括:
- 核心业务源码与算法参数;
- 客户名单、合同条款、报价体系;
- 未披露财务数据、并购与战略计划;
- 任何凭证类信息(密钥、token、账号密码);
- 个人敏感信息(身份证、银行卡、医疗记录)。
4. 网络层兜底:防止”影子 AI”
制度与网关都可能被绕过(员工直接用浏览器或个人 Key 调外部服务),因此需要出口网络管控:
- 防火墙/代理阻断公网 AI 服务域名,仅放行内部 LLM Gateway;
- 终端侧管控(DLP 客户端)监测剪贴板与文件上传行为。
配套原则:必须提供好用的内部合规替代工具。只封禁不供给,必然催生影子 AI,反而让数据流向完全失控——这是治理成败的关键。
参考:《信息安全技术 网络安全等级保护基本要求》(GB/T 22239);NIST AI Risk Management Framework;ISO/IEC 27001 信息分类控制项