整理数据集:像整理错题本一样准备训练资料
先清理重复与错误,再分开训练和评估,结果才容易判断。
1. 好资料,比堆数量重要
数据集是模型实验使用的一组样本,可以包括问题、答案、文本或标签。把它想成一份学习用的错题本:题目重复、答案写错、分类混乱,都会影响学习和检查。样本越多不一定越好。先明确每条记录包含什么、来自哪里、为什么与任务有关,才能知道模型究竟在学习哪些内容。
2. 先做一次基础清理
检查空内容、重复样本、异常长度和不统一的标签,再抽样阅读原始记录。例如同一道问答复制十次,不能简单当作十种不同情况;一个分类名称写成两种拼法,也可能干扰统计。涉及个人信息时,先判断是否需要这些字段,再做必要的脱敏。清理规则要留下记录,方便以后解释样本为什么被保留或删除。
3. 学习材料和考试题分开
训练集用于模型学习,评估集用于检查它在未用于训练的样本上表现如何。如果高度相似的内容落在两边,成绩可能看起来很好,却不能说明泛化能力。可以按资料来源、时间或相似内容组来考虑划分,而不是只随机切开一份已经大量重复的数据。具体方式应服务你的任务和实际数据特点。
4. 给每次整理留个版本
记录样本数量、字段说明、处理规则和修改原因。更换标签或补充数据后,使用固定评估样本重新比较,别把不同版本的成绩直接混在一起。新人可以先拿一小份公开资料,做去重、抽查和版本记录三个练习。先把资料整理得能说明白,再启动训练,能减少实验结束才发现输入有问题的返工。
例如有一百条问答,先抽十条阅读,标出错误、重复和不清楚的答案,再统一修正规则。不要直接把全部数据塞进训练程序。能解释一条样本为什么合格,也能说明评估题为什么保留,才有可靠的实验起点。