数据质量过滤
一句话定位:在规则粗筛之后,用”模型判质量”做精筛——把网页语料里”通顺但没价值”的部分筛掉。这里的核心矛盾不是技术实现,而是质量与数据量的取舍。
1. 分类器打分
标准做法(源自 GPT-3 的数据处理方法):
- 取高质量语料作正样本(如维基百科、书籍、被高质量站点引用的网页);
- 取待过滤的网页语料作负样本;
- 训练一个轻量分类器(如 fastText / 逻辑回归,特征为 n-gram 或哈希特征)——必须轻量,因为要在十亿级文档上推理;
- 对每篇文档打”像高质量语料的程度”分,按分数(常配合按概率的随机保留策略,而非硬阈值)决定保留与否。
要点:分类器判的是”是否像高质量文本的分布“,不是判事实正确性。
2. 规则组合
分类器与规则组合使用、互为补充:
- 规则负责确定性强的硬伤(乱码、模板、超短文本,见 2.2);
- 分类器负责”语法通顺但低信息量”的软伤(SEO 文、内容农场、机器翻译痕迹)。
RefinedWeb(Falcon)的实践进一步说明:只靠严格的规则过滤 + 大规模去重,也能从纯网页数据造出媲美精选语料的高质量数据集,这提示规则与去重的性价比常被低估。
3. 核心 Tradeoff:召回质量 vs 数据量损失
这是本环节唯一真正的决策点:
- 过滤过严 → 语料质量高,但数据量锐减;可能触及模型的数据量下限(Scaling Law 下 token 数不足会直接限制模型上限),且会系统性偏向正样本的风格/领域,损失语料多样性(如误杀口语、少数领域、非主流方言)。
- 过滤过松 → 数据量大,但低质内容拉低训练效率,模型学到噪声模式。
实践取向:按目标 token 预算反推过滤强度——先确定训练需要多少 token,再调阈值使产出量恰好满足,且对被过滤样本做抽样人工核查,确认没有系统性误杀某一类有价值数据。
参考:GPT-3 论文附录数据过滤方法;论文《The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data Only》