压缩方案的四维评估体系
一句话定位:面试考的不是”你会不会量化”,而是”你能不能量化地决策“。把所有压缩手段放进同一张表、用统一四维打分,是把技术选型讲成工程判断的关键产出物。
1. 四个维度
| 维度 | 含义 | 常用指标 |
|---|---|---|
| 效果损失 % | 压缩后模型质量下降幅度 | 任务准确率 / 困惑度 / 业务核心指标的相对下降 |
| 成本降低 % | 服务同样流量所需资源下降 | 显存占用、卡数、单位请求成本($/1k tokens) |
| 吞吐提升倍数 | 单位时间处理能力 | QPS / tokens-per-second 相对基线的倍数 |
| 稳定性 | 是否引入长尾与异常 | P99 延迟、异常率/失败率、输出异常(乱码、截断)比例 |
关键点:稳定性最容易被忽略却最致命——量化可能让平均指标看着没变,却在特定输入上产生崩坏输出(长尾风险);剪枝/蒸馏也可能在少数类别上大幅退化。必须看 P99 与异常率,而不只看均值(同 5.4 基线方法论)。
2. 配合业务可接受阈值
评估表本身不做决策,决策来自业务预先设定的阈值,例如:
“效果损失 < 1%,换取成本降低 40%” → 接受;
“效果损失 3%,成本降 50%” → 拒绝(超出质量红线)。
先与业务方约定阈值,再用表格筛选,避免陷入”哪个技术更先进”的无效争论。
3. 小模型替换纳入同一框架
重要方法论:蒸馏出的小模型 / 直接换用更小的开源模型,应与量化、剪枝在同一张表里比较(见 4.5)。
理由:业务只关心”效果、成本、吞吐、稳定性”,不关心手段。很多时候”换个 7B 小模型”比”把 70B 量化到 INT4”更划算——如果不放进同一框架,就会漏掉这个更优解。
4. 产出物:选型对比表模板
| 方案 | 效果损失% | 成本降低% | 吞吐提升× | 稳定性(P99/异常率) | 实施成本 | 结论 |
|---|---|---|---|---|---|---|
| 基线 FP16 | 0(基准) | 0 | 1.0× | 基准 | — | 参照 |
| PTQ INT8 | 低 | |||||
| GPTQ INT4 | 低-中 | |||||
| QAT INT8/INT4 | 高(需训练) | |||||
| 结构化剪枝 + 微调 | 中-高 | |||||
| 蒸馏小模型替换 | 高 | |||||
| 直接换小模型 | 低 |
使用要求(承接 5.4 / 5.5):固定输入分布与环境、区分预热与稳定态、报告 P50/P99、单变量对比、数据留档。
参考:MLPerf Inference Benchmark 方法论