
DataFlex基准实验解读动态数据调度对MMLU与困惑度带来多少提升【免费下载链接】DataFlex可用于大模型训练时动态进行训练动态训练数据选择、领域比例调整及动态加权提升训练速度和性能与 LLaMA-Factory 无缝集成提供灵活强大的训练控制能力。项目地址: https://gitcode.com/OpenDCAI/DataFlexDataFlex 是一个面向大模型训练的动态数据调度开源框架支持训练过程中的动态数据选择、动态数据配比领域比例调整与动态样本加权并与 LLaMA-Factory 无缝集成、即插即用。本文带你解读项目官方基准实验当训练数据被动态调度后在 MMLU 基准与各数据域困惑度PPL上究竟能带来多少提升基准实验怎么搭MMLU 准确率 分域困惑度项目实验分为两组对应大模型训练中两种最常见的数据调度场景实验组训练数据评测指标对应调度方式数据选择 / 动态加权Open-Hermes-2.5 子集SFT与训练数据相关的 MMLU 子集准确率dynamic_select/dynamic_weight数据配比Data MixtureSlimPajama-627B 子集6B 与 30B 两种 token 规模预训练MMLU 准确率 8 个数据域 PPLdynamic_mix 选择实验中的 LESS 与 NICE 使用由 GPT-5 生成推理轨迹的 MMLU 验证集作为验证集配比实验则分别报告 WebCC/C4、StackExchangeSE、Wiki、GitHub、ArXiv、Book 等 8 个域的 PPL便于看出比例调整对哪个领域帮助最大。仓库内附带了可用于快速熟悉数据格式的小型多模态样例。data/mmfinereason_eval_demo.json 中的题目就是 MMLU 基准同款的选项字母单选风格而 data/mmfinereason_sft_demo.json 中则是带链式思维CoT轨迹的训练样本例如这道几何推理题数据配比结果DoReMi 与 ODM 在 MMLU 和困惑度上提升多少配比实验在 6B 与 30B 两个规模上对比三种方法默认比例基线Baseline、三阶段 DoReMi 与在线式 ODM。关键数据如下加粗为该列最优6B 规模Slim-Pajama-6B方法MMLU Acc ↑总体 PPL ↓SEArXivBookBaseline25.274.2173.4023.5084.778DoReMi25.844.1343.7883.4134.661ODM26.044.2443.2432.9044.61330B 规模Slim-Pajama-30B方法MMLU Acc ↑总体 PPL ↓SEArXivBookBaseline25.513.5842.8504.5405.329DoReMi25.973.5622.7064.4415.214ODM25.633.4292.3823.4874.746三个值得记住的结论MMLU 提升约 0.50.8 个百分点6B 规模下 ODM 26.04 对比基线 25.27净提升0.7730B 规模下 DoReMi 25.97 对比 25.51提升0.46。困惑度红利更明显地出现在特定领域30B 规模下ODM 把 ArXiv 域 PPL 从 4.540 压到 3.487降低约 1.05GitHub 域从 3.163 降到 2.255-0.91DoReMi 则更均衡把 6B 规模的总体 PPL 从 4.217 降到 4.134。两种算法各有专长DoReMi离线优化偏向全面改善ODM在线多臂老虎机式调整在代码GitHub、学术ArXiv领域收益显著且规模增大到 30B 后ODM 的总体 PPL 优势进一步扩大3.429 vs 基线 3.584。数据选择与动态加权对比随机基线均胜出在 SFT 场景Open-Hermes-2.5 子集中官方实验逐一评测了动态选择器LESS、NICE、Loss、Delta Loss、TSDS、NEAR 等与动态加权器Loss、ADAPT、Joint-Update-Aware 等。核心结论✅ 所有数据选择算法在 MMLU 子集上的准确率均超过随机选择Random基线✅ 动态重加权同样带来额外增益说明给每条样本动态调权重与动态挑样本一样值得做ℹ️ 各算法的完整对比曲线请查看仓库 README-zh.md 的实验结果章节。复现实验示例配置与一键启动命令上述实验均可由一份 YAML 一条命令复现主要配置如下DoReMi 三步流水线doremi_step1 → step2 动态配比 → step3 静态精调ODM 在线配比odm_dynamic_qwen_pt_full.yaml动态选择LESSless.yaml算法参数注册表components.yaml启动示例dataflex-cli train examples/train_full/mixers/odm_dynamic_qwen_pt_full.yaml动态行为由warmup_step、update_step、update_times三个参数控制——例如先按常规训练一段热身期之后每隔固定步数重新计算一次数据配比或样本权重。完整参数说明见 how_to_use.md。总结从基准实验中得到的 3 点启示 动态数据调度不是银弹但能在相同训练量下稳定换来约0.50.8 个点的 MMLU 提升以及特定领域0.11.0的困惑度下降追求整体语言建模质量可以选DoReMi想重点强化代码、论文等特定领域可以选ODM如果你已在用 LLaMA-Factory迁移到 DataFlex 是即插即用的——直接复用上述基准配置就能跑出自己的第一组数据调度实验。【免费下载链接】DataFlex可用于大模型训练时动态进行训练动态训练数据选择、领域比例调整及动态加权提升训练速度和性能与 LLaMA-Factory 无缝集成提供灵活强大的训练控制能力。项目地址: https://gitcode.com/OpenDCAI/DataFlex创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考