ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

微调数据工程:1 万条脏数据不如 1 千条干净数据

微调数据工程:1 万条脏数据不如 1 千条干净数据 模型微调决定 SFT 效果的上限的不是训练技巧是数据。我们复盘了三个微调项目数据量从 5 千到 5 万条都试过最终效果与数据量的相关性远弱于与数据质量的相关性。本文总结我们的数据工程实践。一个反直觉的结论LIMA 论文的著名实验1,000 条精选数据微调出的 65B 模型效果可与数万条数据训练的模型竞争。我们在自己的垂直场景复现了这个规律数据集 规模 人工评测胜率 原始爬取数据 52,000 条 基准 简单清洗后 21,000 条 14% 人工精筛重写 4,800 条 27%数据质量的三层含义指令多样性覆盖真实任务分布、回答质量专业、无幻觉、风格统一、格式一致instruction/input/output 结构规范。数据清洗管道defclean_pipeline(raw_data):dataexact_dedup(raw_data)# 1. 精确去重hashdatafuzzy_dedup(data,threshold0.9)# 2. 模糊去重MinHash/Embeddingdatadrop_toxic(data)# 3. 质量/安全分类器过滤datafix_format(data)# 4. 结构校验字段齐全、长度合理databalance_tasks(data)# 5. 任务类型配比调整returndata 几条实战经验1.**模糊去重的收益超预期**。爬取数据里换个问法的同一问题大量存在不处理会让模型过拟合到高频问法。Embedding 相似度0.9以上合并我们砍掉了40%数据。2.**回答风格要统一**。多来源数据混着亲切客服腔和技术文档腔模型学到的是四不像。统一重写回答的风格比增加数据量更有效。3.**难度分布要有梯度**。全是有标准答案的简单 QA模型学不会处理模糊、多步推理的问题。刻意保留20-30%的困难样本多轮、纠错、拒答边界。## 合成数据的正确用法自己没数据时用强模型合成训练数据Self-Instruct 路线。但直接合成有两个坑分布偏窄合成的问题趋同和回答幻觉强模型在你垂直领域也会瞎编。 我们的做法 text1.人工先写50-100条种子样本锚定真实分布2.让强模型基于种子做变体扩展而非凭空生成3.领域事实类回答必须挂真实知识库做 RAG 改写禁止模型自由发挥4.合成数据同样过清洗管道且标注来源便于混比调优数据量的参考基线没有魔法数字但经验区间是通用对话能力对齐1-5 千条精选数据起步垂直领域能力含知识注入8 千-2 万条且知识要同时在检索库里风格对齐几百条高质量样本即可见效。先花两周把数据做好比换三个训练框架都有用。Garbage in, garbage out——大模型时代这句话依然成立。
返回列表