0%

压缩方案的四维评估体系

压缩方案的四维评估体系

一句话定位:面试考的不是”你会不会量化”,而是”你能不能量化地决策“。把所有压缩手段放进同一张表、用统一四维打分,是把技术选型讲成工程判断的关键产出物。

1. 四个维度

维度 含义 常用指标
效果损失 % 压缩后模型质量下降幅度 任务准确率 / 困惑度 / 业务核心指标的相对下降
成本降低 % 服务同样流量所需资源下降 显存占用、卡数、单位请求成本($/1k tokens)
吞吐提升倍数 单位时间处理能力 QPS / tokens-per-second 相对基线的倍数
稳定性 是否引入长尾与异常 P99 延迟、异常率/失败率、输出异常(乱码、截断)比例

关键点:稳定性最容易被忽略却最致命——量化可能让平均指标看着没变,却在特定输入上产生崩坏输出(长尾风险);剪枝/蒸馏也可能在少数类别上大幅退化。必须看 P99 与异常率,而不只看均值(同 5.4 基线方法论)。

2. 配合业务可接受阈值

评估表本身不做决策,决策来自业务预先设定的阈值,例如:

“效果损失 < 1%,换取成本降低 40%” → 接受;
“效果损失 3%,成本降 50%” → 拒绝(超出质量红线)。

先与业务方约定阈值,再用表格筛选,避免陷入”哪个技术更先进”的无效争论。

3. 小模型替换纳入同一框架

重要方法论:蒸馏出的小模型 / 直接换用更小的开源模型,应与量化、剪枝在同一张表里比较(见 4.5)。

理由:业务只关心”效果、成本、吞吐、稳定性”,不关心手段。很多时候”换个 7B 小模型”比”把 70B 量化到 INT4”更划算——如果不放进同一框架,就会漏掉这个更优解。

4. 产出物:选型对比表模板

方案 效果损失% 成本降低% 吞吐提升× 稳定性(P99/异常率) 实施成本 结论
基线 FP16 0(基准) 0 1.0× 基准 参照
PTQ INT8
GPTQ INT4 低-中
QAT INT8/INT4 高(需训练)
结构化剪枝 + 微调 中-高
蒸馏小模型替换
直接换小模型

使用要求(承接 5.4 / 5.5):固定输入分布与环境、区分预热与稳定态、报告 P50/P99、单变量对比、数据留档。

参考:MLPerf Inference Benchmark 方法论