一项关于数学微调数据的研究比较了两种组织方式:让训练样本与目标题属于同一个数学主题,或者让样本使用同一种解题方法但来自不同主题。实验覆盖概率、组合、数论和几何,并用平衡的 2×2 设计减少题目质量等因素的干扰。
在五个基础模型、每组三个训练种子的 40 个模型—目标比较中,共享推理方法的数据都优于共享主题的数据。第一组实验的模型级优势为 8.2 至 16.2 个百分点,第二组为 12.0 至 16.0 个百分点。作者还发现,主题相同的样本在词汇和嵌入相似度上反而更接近目标,说明表面相似并不是这组实验里的关键因素。
结果只覆盖论文中测试的主题和方法组合,不等于所有领域的微调都应该放弃主题组织。对构建数学或推理数据集的人,它提供了一个很具体的检查方向:除题目标签外,记录解法、证明套路和中间步骤,也许比单纯按学科分组更能帮助模型迁移。