数据配比与混合策略
一句话定位:清洗完成后,各领域数据”按什么比例喂、喂几遍”直接决定模型的能力画像。这是从”数据工程”跨向”训练效果”的关键决策环节。
1. 各域采样权重
预训练语料由多个域构成(网页 / 书籍 / 代码 / 多语言 / 论文等),各域数据量差异极大(网页占绝对多数),若按自然比例采样,模型会被网页数据主导。
因此需要人为设定采样权重(reweighting):
- 上采样高质量但量小的域(书籍、百科、论文)——提高知识密度与长文本连贯性;
- 下采样量大但质量参差的域(网页);
- 代码比例影响推理与结构化能力;多语言比例影响跨语言能力,且与目标语言的能力存在竞争(挤占效应)。
The Pile 的做法即为典型:由 22 个子数据集构成,每个域显式指定采样权重,使最终 token 分布与自然分布显著不同。
2. 重复轮次(Epoch)设计
同一域的数据可被重复训练多轮,但重复不是免费的:
- 高质量小域适度重复(如 2~4 epoch)能提升收益;
- 重复过多会导致记忆化(memorization)与过拟合,边际收益快速衰减,甚至损害泛化;
- 因此”有效 token 数”应折算重复轮次来计算,而非简单相加。
这与 2.4 去重是一体两面:去重是消除非预期的重复,epoch 设计是引入受控的重复。
3. Data Mixing Laws:用小规模实验预测配比
核心思路:不必用全量算力试错配比——
- 在小规模(小模型 / 少量 token)上跑多组不同混合比例的实验;
- 拟合出”混合比例 → 最终 validation loss”的函数关系(可解析的规律形式);
- 用该函数外推预测大规模训练下的最优混合比例,再投入真正的大规模训练。
价值:把”配比”从依赖直觉的玄学,变成可低成本量化预测的工程问题。这与 1.2 中”提前抽样发现问题而非事后救火”的方法论完全同源——先用小成本实验建立可外推的基线,再投产。
参考:论文《The Pile》配比章节;论文《Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance》