0%

AI开发技术图谱

岗位评估、项目素材库、面试执行手册等内容已拆分至 AI 岗位评估,本文档只保留知识体系本体。

1 分布式计算基础(存量强项,巩固为面试语言)

一句话定位:这是我的地基,面试中要把它讲成”可迁移到 GPU/AI 平台的调优方法论”,而不是单纯的框架使用经验。

1.1 Spark 核心执行模型

要点:DAG 构建 → Stage 按宽依赖切分 → Task 并行执行;Shuffle 是 Stage 边界,也是绝大多数性能问题的发源地。
面试点:优化只有三条路——减少 Shuffle 次数(Broadcast Join)、减少 Shuffle 数据量(map 端预聚合 + 列裁剪)、让 Shuffle 后分区均匀(倾斜治理 + AQE)。
类比:Stage 同步屏障 ≈ GPU Kernel 同步点;Task 长尾 ≈ 静态 Batching 木桶效应;Shuffle 磁盘/网络开销 ≈ HBM 读写瓶颈(对应 3.7 FlashAttention)。
参考:Apache Spark 官方文档 RDD Programming Guide / Tuning Guide

1.2 数据倾斜的成因与治理

要点:成因是 key 分布不均导致单 Task 长尾;手段包括加盐打散、两阶段聚合(局部+全局)、Broadcast Join 消除 Shuffle、倾斜 key 单独处理。
面试点:能说清如何提前抽样发现倾斜,而非事后救火。

1.3 Spark 内存管理与 GC 调优

要点:Executor 内存模型(执行内存 / 存储内存的统一动态借用、堆外内存);GC 频繁通常源于分区过小、对象过多或缓存过量。

要点:State Backend 选型(内存/RocksDB)、Checkpoint 的 Barrier 对齐机制、Exactly-Once 语义如何达成。

1.5 Ray 分布式计算核心概念

要点:Actor 模型(有状态)vs Task(无状态)、分布式对象存储(Plasma)、动态任务图调度。
面试点为什么 AI 数据处理链路里 Ray 常比 Spark 更合适(异构资源、Python 原生、细粒度动态调度)。

1.6 I/O 优化手段

要点:列式存储的投影下推/谓词下推收益来源、压缩算法选型(Snappy 快 vs Zstd 压缩比高)、小文件合并对元数据与调度开销的影响、异步预取与 MMap。

1.7 数据格式对比:JSONL / Parquet / Arrow / ORC

要点:JSONL 需逐行解析(CPU 瓶颈),Parquet 列式+压缩(存储与扫描友好),Arrow 内存零拷贝列式(跨语言传输友好),ORC 与 Hive 生态强绑定。
面试点JSONL→Parquet/Arrow 的吞吐提升主要来自”消除文本解析 + 只读需要的列 + 零拷贝”三点

1.8 资源调度与执行计划优化

要点:YARN/K8s 的资源撮合逻辑、任务优先级与抢占、AQE(自适应查询执行)如何在运行时改分区数与 Join 策略。

1.9 数据管道全链路设计范式

要点:接入→清洗→转换→输出的分层解耦、算子抽象与可复用性、幂等与重试设计、CPU 密集与 GPU 密集环节的资源池分离。

2 大模型数据工程(预训练全流程)

一句话定位:这是岗位 B/C 的日常工作主体,必须能从原始网页一口气讲到 Token ID,并在每个环节标出瓶颈与优化手段。

全流程主干:采集 → 格式提取 → 语言识别 → 规则过滤 → 质量过滤 → 去重 → 脱敏 → 配比混合 → Tokenization → 二进制打包

2.1 预训练数据采集与来源

要点:网页(Common Crawl)/ 文档 / 代码等多源异构;WARC 格式提取正文的难点(去模板、去导航)。
参考:Common Crawl 官方文档;论文《The Pile: An 800GB Dataset of Diverse Text》

2.2 语言识别与规则过滤

要点:fastText 语言分类器打分 + 阈值;规则过滤维度(长度、符号占比、重复行、停用词密度)。瓶颈:纯 CPU 密集,靠并行度与批量化提速。
参考:fastText 官方文档;论文《CCNet》

2.3 数据质量过滤

要点:分类器打分(以高质量语料为正样本训练轻量分类器)+ 规则组合;核心 Tradeoff 是召回质量 vs 数据量损失。
参考:GPT-3 论文附录数据过滤方法;论文《The RefinedWeb Dataset for Falcon LLM》

2.4 MinHash / LSH 模糊去重(高频必问)

要点:Shingling → MinHash 签名(用最小哈希估计 Jaccard 相似度)→ 分带(Banding)分桶 → 桶内两两比对 → 连通图求重复簇。工程要点:签名长度与 band 数决定精确率/召回率的权衡;Hash 计算是 CPU 热点,桶内比对易数据倾斜。
参考:《Mining of Massive Datasets》第 3 章;论文《Deduplicating Training Data Makes Language Models Better》

2.5 数据脱敏(PII)

要点:正则 + NER 双路识别(邮箱/手机号/身份证/密钥),替换而非删除以保持文本结构;需权衡误杀率。
参考:Microsoft Presidio 官方文档;论文《Scrubbing Sensitive PII from Large Datasets》

2.6 数据配比与混合策略

要点:各域(网页/书籍/代码/多语言)采样权重与重复轮次(epoch)设计;Data Mixing Laws 思路是用小规模实验预测混合比例对最终 loss 的影响。
参考:论文《The Pile》配比章节;论文《Data Mixing Laws》

2.7 Tokenization:BPE 原理

要点:从字符起始,贪心合并语料中频率最高的相邻符号对,直到词表大小达标;解决 OOV 与词表爆炸。
参考:论文《Neural Machine Translation of Rare Words with Subword Units》

2.8 Tokenization:SentencePiece 原理

要点:直接在原始文本(无需预分词)上训练,支持 Unigram 语言模型式的概率化子词切分,天然适配中日韩等无空格语言。对比 BPE:Unigram 是概率最优切分,BPE 是频率贪心合并。
参考:论文《SentencePiece》;官方 GitHub 文档

2.9 DataLoader 参数调优

要点:num_workers(并行加载子进程数,过高会抢 CPU 与内存)、pin_memory(锁页内存让 H2D 拷贝可异步 DMA)、prefetch_factor(每 worker 预取批数,掩盖 I/O 延迟)。判断依据:GPU 利用率呈锯齿状 → 数据供给不足。
参考:PyTorch 官方文档 torch.utils.data.DataLoader

全流程瓶颈图(面试白板可直接画):格式提取(CPU/解析)→ 语言识别(CPU/模型推理)→ 质量过滤(GPU/批量推理)→ 去重(CPU Hash + Shuffle 倾斜)→ Tokenization(CPU 密集)→ 打包(I/O + 格式)。

3 GPU 推理与 CUDA 体系(最大缺口,P0)

一句话定位:用大数据的调度/内存/批处理直觉去理解 GPU,是我最快的学习路径,也是面试中最好的表达桥梁。

3.1 CUDA 编程模型基础

要点:Grid → Block → Thread 三层层次,Warp(32 线程)是真实调度单位,SM 是执行硬件;显存层次为寄存器 > 共享内存 > L2 > 全局内存,速度差数量级。
类比:Warp 调度 ≈ Spark Task 调度;显存层次 ≈ 内存/磁盘分层存储。
参考:《CUDA C++ Programming Guide》

3.2 显存管理与 OOM 排查

要点:常见成因——batch/序列过长、显存碎片化、中间张量未释放、缓存分配器未归还;排查手段——nvidia-smi、PyTorch 显存快照与 memory_summary、分析分配器保留内存 vs 实际使用内存的差值。
参考:PyTorch 官方文档 CUDA semantics

3.3 性能瓶颈定位方法(利用率/吞吐/并发/调度/通信)

要点:先判定瓶颈类别——GPU 利用率低但 CPU 满 → 数据供给或前处理瓶颈;Kernel 间有空隙 → 调度/同步问题;多卡场景吞吐不线性 → 通信瓶颈。
面试点:必须能回答”你怎么知道是 GPU 而不是 CPU 瓶颈”。
参考:Nsight Systems 用户指南;nvidia-smi 手册

3.4 KV Cache 机制与优化

要点:自回归生成中缓存历史 token 的 K/V 避免重复计算,代价是显存随 batch × 序列长度线性增长,成为吞吐上限的主因;优化方向包括分页管理、量化 KV、共享前缀复用。
参考:PagedAttention 论文;Hugging Face 博客《LLM 推理中的 KV Cache 详解》

3.5 vLLM 与 PagedAttention

要点:借鉴操作系统虚拟内存分页,把 KV Cache 切成固定大小 block 非连续存放,消除显存碎片与预留浪费,显存利用率大幅提升;配合前缀共享(Copy-on-Write)。
参考:论文《Efficient Memory Management for LLM Serving with PagedAttention》(Kwon et al., 2023);vLLM 官方文档

3.6 Continuous / Dynamic Batching

要点:静态 Batching 需等最长序列跑完(木桶效应,GPU 空转);Continuous Batching 在迭代粒度上完成即出队、新请求即插入,显著提升吞吐。Dynamic Batching 则是服务层按时间窗口/队列深度聚合请求。
类比:≈ 流式微批 vs 攒批处理。
参考:NVIDIA Triton Inference Server 文档 Dynamic Batching 章节

3.7 FlashAttention 原理

要点:Attention 的瓶颈是 HBM 读写而非算力(IO-bound);通过 Tiling 分块 + 在片上 SRAM 内融合 softmax(online softmax)避免物化 N×N 注意力矩阵,减少显存读写并降低显存占用,且是精确而非近似。不要求推公式,要能说清优化动机。
参考:论文《FlashAttention》(Dao et al., 2022) 及 FlashAttention-2

3.8 TensorRT-LLM 架构与部署流程

要点:编译式优化路线——图优化与算子融合、Kernel 自动选优、量化集成、In-flight Batching、多 GPU 并行策略封装;流程为模型转换 → 构建 Engine → 部署(常配 Triton)。代价是编译耗时与灵活性下降。
参考:NVIDIA TensorRT-LLM 官方文档与 GitHub

3.9 SGLang 架构与适用场景

要点:面向结构化/多轮/复杂控制流的 LLM 程序,核心是 RadixAttention 前缀树复用 KV Cache + 前端 DSL 编排,适合 Agent、批量结构化抽取等前缀高度重复的场景。
参考:论文《SGLang: Efficient Execution of Structured Language Model Programs》;官方文档

3.10 多卡/多机的通信与调度瓶颈

要点:张量并行(TP,通信密集,宜同机 NVLink)vs 流水并行(PP,气泡问题);NCCL 的 AllReduce/AllGather 原语与拓扑感知;判断通信瓶颈的方法是看扩展效率是否线性。
参考:NCCL 官方文档;论文《DeepSpeed-Inference》

面试串讲路径(一次推理请求的一生):请求进入 → 服务层 Dynamic Batching 聚合 → 调度器按 Continuous Batching 组 batch → Prefill(FlashAttention 计算,写入 KV Cache 分页 block)→ Decode 逐 token 迭代(复用 KV Cache)→ 完成即出队释放 block → 返回。能画出这张图并标注每个位置的优化点,3 章基本过关。

4 模型压缩与量化

一句话定位:面试考的不是算法推导,而是**”效果/成本/吞吐/稳定性”四维 Tradeoff 的量化评估能力**。

4.1 量化基础:INT8/INT4 数值表示与精度损失

要点:用 scale/zero-point 把浮点范围映射到低位整数;精度损失来自动态范围截断与舍入,异常值(outlier)是主要杀手;对称/非对称、逐张量/逐通道/逐组粒度的取舍。收益:显存减半以上 + 带宽降低 + 低精度算力更高。
参考:论文《A Survey of Quantization Methods for Efficient Neural Network Inference》

4.2 PTQ(训练后量化)

要点:仅需少量校准集统计激活分布,成本极低、不改训练流程,适合快速上线;INT8 通常损失可控,INT4 需更精细算法。
参考:NVIDIA TensorRT 量化文档

4.3 QAT(量化感知训练)

要点:训练中插入伪量化节点,用 STE 近似梯度,让模型自适应量化噪声;精度保留更好但需训练资源与数据,适合精度敏感场景。
参考:PyTorch 官方文档 Quantization(QAT 章节)

4.4 GPTQ 算法

要点:逐层、逐列量化并用二阶信息(Hessian 近似)对未量化权重做误差补偿,使 INT4 也能保持较好精度;一次校准即可,无需训练。
参考:论文《GPTQ》(Frantar et al., 2022)

4.5 知识蒸馏

要点:Teacher 输出软标签(带温度的概率分布)承载类间相似性信息,Student 用软标签 + 硬标签联合 Loss 学习;适合把大模型能力迁到小模型以降本。
参考:论文《Distilling the Knowledge in a Neural Network》(Hinton et al., 2015)

4.6 模型剪枝

要点:非结构化剪枝压缩率高但稀疏不规则,通用硬件难获实际加速;结构化剪枝(整通道/整头/整层)能真实提速但精度损失更大。
面试点:区分”理论 FLOPs 下降”与”实际墙钟加速”。
参考:论文《The State of Sparsity in Deep Neural Networks》;综述《A Survey on Deep Neural Network Pruning》

4.7 压缩方案的四维评估体系

要点:建立「效果损失% × 成本降低% × 吞吐提升倍数 × 稳定性(长尾/异常率)」评估表,配合业务可接受阈值(如效果损失<1% 换成本降 40%);小模型替换也纳入同一框架比较。
产出物:一份「压缩方式 × 四维」选型对比表模板。
参考:MLPerf Inference Benchmark 方法论

5 Profiling 与性能分析(方法论比工具更重要)

一句话定位:面试真正考的是**”不凭感觉优化”**——先量化基线,再定位,再验证收益。

5.1 PyTorch Profiler

要点:采集 CPU/GPU 时间线、算子耗时排序、显存占用趋势、Kernel 与 Python 栈关联;关键指标是 GPU Kernel 占比与算子 Top-N 耗时。
参考:PyTorch 官方 Profiler 教程

5.2 Nsight Systems

要点:系统级时间线,看 Kernel 执行、H2D/D2H 拷贝、CUDA Stream 并发与同步点;Kernel 之间的空隙就是 GPU 空转,是首要优化目标。
参考:NVIDIA Nsight Systems 用户指南

5.3 大数据工具 → GPU 工具的概念映射(我的表达优势)

要点映射表:Spark UI 的 Stage/Task 耗时分布 ↔ Nsight 的 Kernel 时间线;Shuffle 读写量 ↔ 显存带宽/拷贝量;长尾 Task ↔ 长尾 Kernel / 木桶效应 batch;Executor 内存溢出 ↔ 显存 OOM。
参考:Spark 官方文档 Web UI 章节;Flink 官方文档 Web UI 章节

5.4 性能基线(Benchmark)建设方法论

要点:固定输入分布、固定环境、区分预热与稳定态、报告 P50/P99 而非仅均值、明确吞吐与延迟的取舍点。
参考:MLPerf Benchmark 方法论

5.5 Profiling 驱动优化的标准动作

要点:采集基线 → 定位 Top 耗时算子/Stage → 提出假设与预期收益 → 单变量验证 → 前后对比数据留档 → 沉淀为工具/模板。
面试点:这套动作在 Spark 和 GPU 上完全同构,是我最强的可迁移叙事。
参考:NVIDIA《GPU Performance Analysis and Optimization》博客系列

6 系统级语言(P2,达到”能读能聊”即可)

6.1 C++ 内存管理

要点:RAII(资源获取即初始化,靠析构自动释放);unique_ptr 独占所有权、shared_ptr 引用计数(注意循环引用用 weak_ptr 破除)。
参考:《Effective Modern C++》

6.2 C++ 并发原语

要点:线程池的任务队列与工作窃取;mutex 适合临界区较大,atomic 适合简单计数/标志;内存序概念存在感知即可。
参考:《C++ Concurrency in Action》

6.3 Rust 所有权机制(若岗位倾向 Rust)

要点:所有权 + 借用检查在编译期消除数据竞争与悬垂指针;与 C++ 手工管理的对比是核心话术。
参考:《The Rust Programming Language》(The Book)

6.4 CUDA Kernel 代码阅读能力

要点:找向量加法、朴素矩阵乘、reduction 三段代码,读懂全局索引计算(blockIdx*blockDim+threadIdx)、边界判断、共享内存复用、内存访问是否合并(coalesced)。
产出物:能口头讲清一段 CUDA Kernel 的执行逻辑与访存模式。
参考:《CUDA C++ Programming Guide》;NVIDIA CUDA Samples

7 AI Agent 架构(岗位 A 核心,C 加分)

7.1 Agent 基本范式

要点:感知 → 规划 → 执行 → 观察的闭环;ReAct 让推理(Thought)与行动(Action)交替,使决策过程可追踪、可干预。
参考:论文《ReAct: Synergizing Reasoning and Acting in Language Models》

7.2 LangChain 核心组件

要点:Chain(任务链组合)、Memory(会话状态)、Retriever(检索增强)、Tool(外部能力);本质是 LLM 调用的编排与抽象层。
参考:LangChain 官方文档

7.3 LangGraph 状态机式编排

要点:把 Agent 流程建模为带状态的图,支持条件分支、循环、检查点与人工介入;相比线性 Chain 更适合复杂可控流程。
类比:≈ 大数据任务调度的 DAG 编排 + 状态回放。
参考:LangGraph 官方文档

7.4 工具调用(Function Calling / Tool Use)

要点:以 JSON Schema 描述工具,模型生成结构化参数,框架校验并路由执行,结果回填上下文再次推理;难点是参数幻觉与失败重试。
参考:OpenAI 官方文档 Function calling;论文《Toolformer》

7.5 多 Agent 协作模式

要点:Supervisor 模式(主 Agent 分派与汇总,职责清晰易控)、辩论/互评模式(多 Agent 交叉校验提升事实性,代价是成本翻倍);选型看任务是否可分解与对准确性的要求。
参考:论文《AutoGen》;论文《Improving Factuality and Reasoning through Multiagent Debate》

7.6 Agent 记忆机制

要点:短期记忆 = 上下文窗口(需摘要压缩);长期记忆 = 向量库存储历史交互并按相关性召回;MemGPT 思路是把上下文当”内存”、外部存储当”磁盘”做分页调度。
参考:论文《MemGPT》;LangChain Memory 文档

7.7 Agent 可靠性保障

要点:幻觉控制(检索接地、结构化输出约束、自校验)、异常处理(超时/重试/降级)、Human-in-the-loop 关键节点人工确认、全链路可观测与回放。金融场景尤其要强调可审计。
参考:论文《Survey of Hallucination in NLG》;LangChain Human-in-the-loop 文档

8 AI 平台 / 多模态 / RAG(岗位 A、C 的复习重心)

8.1 AI 平台全流程架构(MLOps)

要点:数据标注 → 训练 → 评估 → 部署 → 监控 → 反馈闭环;关键能力是实验可复现、模型版本与血缘、自动化流水线、线上效果监控与回滚。
参考:Google Cloud《MLOps: Continuous delivery and automation pipelines in machine learning》

8.2 模型托管服务设计要点

要点:镜像与环境标准化、弹性伸缩与冷启动、多版本灰度与 A/B、资源配额与多租户隔离、推理网关统一鉴权与限流。
参考:华为云 ModelArts 文档;AWS SageMaker 文档

8.3 向量数据库选型与应用

要点:索引结构(HNSW 图索引低延迟高内存 / IVF-PQ 省内存有损)、召回率 vs 延迟调参、过滤条件与向量检索的结合、写入与重建索引成本;自建(Milvus)vs 托管(Pinecone)的取舍。
参考:Milvus 官方文档;Pinecone《Vector database fundamentals》

8.4 RAG 检索增强链路(我的缺口,需做最小落地项目)

要点:切片策略(长度/语义/重叠)→ Embedding 模型选型 → 向量+关键词混合召回 → Rerank 重排 → 上下文组装 → 生成;评估维度是召回率、忠实度(faithfulness)、答案相关性。
目标:产出一个”多模态检索 + RAG”最小可用项目作为面试差异化素材。

8.5 全模态数据处理认知(我的缺口)

要点:图像/视频/音频/3D 的特征提取与预处理算子差异(解码、抽帧、重采样、点云体素化);跨模态对齐(cross-modal embedding,CLIP 式对比学习);多模态训练数据的配对组装与质量校验。视频/3D 的存储与 I/O 成本是平台设计的主要矛盾。
路径:借 Flink stream-native-AI / FLIP-577 多模态处理方向深入。

8.6 异构算力编排(CPU/GPU/NPU)

要点:按算子画像分类调度(CPU 密集清洗 vs GPU 密集打标)、资源池分离与撮合、异构卡型的能力抽象与自动降级、失败恢复与断点续跑。
素材:把 DeepOps 巡检/失败监控 + DAG 编排包装成”百亿级数据异构卡型自动化处理”的故事。

8.7 CI/CD 在 AI 平台的落地

要点:代码/数据/模型三者版本联动、流水线触发条件、离线评估门禁(不达标不上线)、渐进式发布。
参考:Google MLOps 白皮书;Kubeflow 官方文档

8.8 数据资产化与标准化方法论

要点:标准化(统一 Schema/算子接口)→ 流程化(可编排的模板与 SOP)→ 资产化(可检索、可复用、可计量的数据与算子资产);配套元数据、血缘、质量分与权限治理。
素材:uqs SQL 模板引擎 + ADR 驱动的平台抽象 + DeepOps 平台经验。
参考:《数据中台》行业白皮书;Netflix Tech Blog《Machine Learning Platform》系列

9 AI 数据安全与合规(平台岗高频,落地必答)

一句话定位:调用大模型时如何避免核心业务机密泄漏给基座公司。答题主线是分层设防——数据不出域 > 出域但不可还原 > 出域可还原但有合同约束,四件套(分级 + 网关 + 脱敏 + 合同)叠加使用,单一手段都不够。

9.1 数据分级与出域管控

要点:公开/内部/秘密/机密四级分类与各级允许的出口;按数据分级做模型路由(机密走内网自部署、内部走企业版 API)是最具性价比的架构决策;红线清单显式列举;出口网络阻断防”影子 AI”。
面试点:不是”全私有化”或”全公有 API”二选一,而是按级别分流,把昂贵算力只用在真正需要的流量上。
参考:GB/T 22239 等保要求;NIST AI Risk Management Framework

9.2 LLM Gateway 与 DLP 拦截

要点:禁止业务代码直连大模型 API,全部收敛到内部网关;网关集中实现 DLP 扫描(正则+关键词+分类器)、阻断/降级路由、脱敏回填、全量审计日志、密钥托管、配额限流、输出侧过滤。
易漏点:只管 chat 接口而漏了 embedding 接口——向量化同样会把原文发给厂商。
参考:OWASP Top 10 for LLM Applications;CSA《AI Controls Matrix》

9.3 脱敏、假名化与数据最小化

要点:出站替换为 <CUSTOMER_1> 等占位符、映射表留在内网、返回后本地回填,厂商侧全程只见占位符;数据最小化(RAG 只送 Top-K 切片、能用摘要不送原文、结构化剥离)。
核心 Tradeoff:脱敏强度 vs 模型效果——与 2.5 PII 的误杀率权衡同源,必须抽样评估脱敏前后的任务质量,而非只看替换数量。
参考:Microsoft Presidio 文档;GDPR 第 4 条;《个人信息保护法》去标识化条款

9.4 厂商合同与合规要点(零数据保留)

要点:零数据保留 + 不用于训练必须写进合同(个人版/免费版通常默认会用于训练,企业版才提供承诺);DPA、数据驻留地与跨境合规;审计权、删除权、留存期限;厂商资质核查。
验证手段Canary Token 植入独特字符串后定期探测模型是否复现,是少数能实测厂商承诺的方法;配合记忆化探测与账单对账。
认知:合同是最后一层不是第一层,仅靠合同的方案在机密数据面前不合格。
参考:《个人信息保护法》出境条款;GDPR 第 28 条与第五章

9.5 RAG 权限隔离与越权防护

要点:内部知识库最高频的泄漏场景是内部越权(向量检索天然无视 ACL);必须检索时预过滤(pre-filter 优于 post-filter)、按敏感级分库分区、权限变更同步向量库元数据、强制引用溯源。
附带风险:间接 Prompt 注入——把检索内容当不可信数据处理,配合最小工具权限与人工确认(呼应 7.7)。
参考:OWASP LLM01 Prompt Injection / LLM06 Sensitive Information Disclosure

9.6 私有化部署选型与落地优先级

要点:三形态取舍(私有化开源模型最安全 / VPC 独占实例折中 / 公有 API+治理最低成本);引擎选型对应 3.5 vLLM、3.9 SGLang、3.8 TensorRT-LLM;用量化(第 4 章)降卡数是私有化经济可行的关键。
落地优先级:数据分级与红线 → LLM Gateway+审计+出口阻断 → 签零保留条款 → 网关加 DLP 与脱敏 → 私有化承接机密流量 → Canary 与权限复核持续验证。
误区:一上来全私有化(成本失控、业务绕过);只签合同不做技术管控;忽略 embedding 通道;对外防住却在 RAG 对内泄漏。
参考:vLLM / SGLang / TensorRT-LLM 部署文档;NIST AI RMF