基准分数偏乐观的一个常被低估的原因,是题目或答案本身已经混进了训练数据。当测试样本、标准答案,乃至它们的高度相似改写已进入预训练或后训练语料时,模型给出的高分可能来自“回忆”而非“求解”。这种虚高会让公开榜单系统性地偏高,而且越是被广泛引用的题集,越难保证干净——它们在互联网上被转载、讨论、整理成教学材料的概率更大,被动进入语料的路径也更多。
识别污染的第一条线索是来源与时间。如果用来复核的样本是私有采集的、且采集时间晚于模型训练数据的截止日期,模型就不可能提前见过这些题。用这类样本重测,若分数相对公开榜明显回落,就提示公开结果中含有记忆成分。反过来,只在那些流传已久的标准题集上表现突出,而在新采集的同类任务上掉队,是污染的典型信号。
第二条线索来自作答方式的异常。一个真正在推理的模型,面对封闭题通常会显露路径:中间步骤、对条件的使用、偶尔的犹豫。若模型对某些题目给出的答案异常笃定、格式与某个流行题集高度一致,甚至在题干被轻微改写、数值被替换后仍机械地复述原答案而不是重新计算,这种“换汤不换药仍答对、换药后反而答错”的落差,往往意味着它背的是答案而非方法。因此,用改写题干、替换数值、打乱选项顺序等扰动做对照测试,是分辨记忆与能力的实用手段。
微调场景需要额外警惕。比较微调前后的提升时,必须确认新增训练数据没有把评测题本身学了进去。否则所谓的能力增长无法归因,只是把考题提前告诉了模型。保留评测题的版本记录、核对训练数据与评测集是否存在重叠或近似重复,是让提升可被解释的前提。
需要强调的是,污染并非孤立问题,它和提示过拟合、只报最好一次运行等做法会叠加放大乐观偏差。反复对着同一套题改提示直到分数好看,测量的是“提示加模型”在这套题上的拟合程度;若题目又恰好被模型见过,两重偏差会让名次更不可信。
实践上,可行的做法是把公开榜仅当作候选筛选,真正的复核交给与上线分布接近、且确定未参与过训练与提示调优的样本。样本不必很大,但要覆盖那些不能接受的错误类型,并在协议冻结后尽量不改。当新采集样本上的表现与公开高分出现系统性背离时,更稳妥的判断不是模型更强,而是那次测试里有一部分分数来自它早已知道的答案。
文章版权归作者所有,未经允许请勿转载。
本文链接:https://www.chatcpt.com.cn/thread/benchmark-data-contamination/
参与讨论
暂无评论,快来发表你的观点吧!