ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

机器学习训练秘籍(Machine Learning Yearning 中文版)第35章精读:算法超越人类表现水平后如何继续取得进展

机器学习训练秘籍(Machine Learning Yearning 中文版)第35章精读:算法超越人类表现水平后如何继续取得进展 文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载导读本章_docs/Comparing to human-level performance/ch35.md聚焦一个许多团队迟早会遇到的关键阶段当机器学习算法在开发集或测试集上的表现已经超越人类时如何继续驱动快速进展。文章以语音识别为实例说明人类水平并非一个全局统一的阈值——只要存在人类仍占优势的数据子集第33章介绍的三种核心技术获取人工标签、利用人类直觉做误差分析、以人类表现作为期望目标就依然有效。读完本文你将掌握在超人类阶段继续推进项目的具体策略、判断依据以及它与最优错误率贝叶斯错误率、可避免偏差等概念之间的内在联系。本文基于开源仓库 machine-learning-yearning-cn《机器学习训练秘籍》中文版的章节文档展开全篇以 第35章原文 为骨架并结合仓库内 第33章、第34章、第22章 等关联章节做纵深扩充帮助你完整理解该主题在全书知识体系中的位置。一、问题的起点一个看起来没有改进空间的语音识别项目设想你现在负责一个语音识别项目手中有一批音频片段数据集。这批数据集的显著特点是噪声很大以至于即使换人类来听写也会产生10% 的误差。与此同时你的算法已经达到了8% 的误差——比人类平均水平还要低 2 个百分点。此时一个很自然的困惑出现了既然算法已经超越了人类那么是不是意味着我们已经榨干了所有提升空间答案是否定的。关键在于人类表现水平从来不是一个单一的全局数字而是一个与数据子集数据分布强相关的函数。你的算法虽然在含噪音频这个子集上优于人类但人类在另一些子集上可能依然具有明显优势。原文档给出的典型例子是系统在转录含噪语音时已经胜过人类但在转录语速很快的语音时人类仍然占优。正是这种子集层面的差异为继续取得快速进展保留了入口。这也呼应了全书反复强调的思想——不要只盯着一个笼统的总误差数字而要深入到具体的误差来源和数据切片中去分析参见仓库中 基本误差分析章节 系列文档的思路。二、超人类阶段仍然有效的三种核心技术原文档明确指出只要你能找到人类表现水平远超现有系统的数据子集第33章_docs/Comparing to human-level performance/ch33.md介绍的三种技术就依然可以用于驱动进展。以语速很快的语音这个子集为例你仍可以从输出质量比你的算法高的人那儿获取转录数据。既然人类在这类语音上听得更准那么请人来转录这些片段产出的标签质量就高于算法自身的输出可用于继续训练或微调模型。你可以利用人类的直觉来理解为什么你的系统没能够识别这些数据而人类做到了。例如人类可能依靠上下文中更细微的韵律、语义线索来推断语速极快语音中的词汇这些直觉可以转化为对特征、预处理或模型结构的改进方向。你可以使用该子集上的人类表现水平作为期望表现目标。它给出了一个合理可达的误差基准帮助你判断可避免偏差还有多大从而决定是否继续投入。三、技术适用条件的精确表述原文档对适用范围给出了一个非常精确、也经常被误读的表述更常见的做法是只要在开发集上存在着一些人类能正确处理而算法不能的样本前面提到的技术就能够被应用。即使你的算法在整个开发集或是测试集上的表现已经超过了人类这样做也是正确的。这句话值得拆解判断依据不是总误差谁高谁低而是是否存在算法出错而人类能纠正的具体样本只要存在这样的样本就说明算法在该样本所属的子分布上仍有可学习的空间因此即使全局指标已经超人类三种技术依然可以合法、有效地使用。反过来当人类也很难识别出算法明显出错的样本时——也就是说连人类都无法判断哪个输出才是正确的——上述一小部分技术才不再适用。这正是下文要讨论的人类不擅长的任务场景。四、机器已超越人类的任务进展为何变慢原文档列举了多个在现实世界中机器已经超越人类的重要应用更好地预测电影分级预测一辆送货车到某个地方需要多长时间判断是否批准贷款申请。这些任务的共同特点是人类很难稳定地给出正确答案因此获取高质量标签很难——人工标注者无法可靠地标注最优结果参见 第33章 中人类不擅长的任务的论述如图书推荐、广告选择、股市预测人类直觉难以依靠——没有人能凭直觉准确预测股市当算法表现比随机猜测还差时也就难以借助人类经验判断改进方向最优错误率和合理的期望错误率难以确定——没有人类水平作为参考你很难知道系统还能改善多少。因此在机器已经超越人类水平的问题上进展通常比较慢而当机器仍在试图赶上人类水平时——即仍处于人类擅长、人类表现可作为基准的领域——进展速度反而更快。这个非对称性是本章最核心的实践洞察之一它提醒团队在选择项目、设定目标和安排研究优先级时要清醒地认识到所处阶段。五、人类表现水平作为最优错误率的代理要理解为什么超人类阶段仍能以上述三种技术取得进展需要把视野拉回到本书的误差分解框架。在 第22章与最优错误率比较 中总误差被分解为最优错误率贝叶斯错误率Bayes error rate——不可避免偏差即世界上最好的系统也无法消除的误差可避免偏差avoidable bias——训练错误率与最优错误率之差方差variance——开发/测试错误率与训练错误率之差。其中偏差 最优错误率 可避免偏差。对人类擅长的任务人类表现水平就是对最优错误率最实用的估计第34章 以医学影像诊断为例详细演示了如何定义人类表现水平。因此在含噪语音、语速很快的语音这类人类擅长处理的任务中即使算法的总体误差已经低于人类平均值只要在某个子集上仍有人类正确而算法错误的样本就说明该子集上仍存在可避免偏差也就意味着降低偏差的技术更多相关数据、更强的模型、更好的特征等仍有发挥作用的空间。5.1 一个可操作的自检流程结合 第34章 关于如何定义人类表现水平的方法普通无背景者 15% → 新手医生 10% → 资深医生 5% → 医生团队讨论 2%在超人类阶段你可以这样操作拆解开发集按噪声水平、语速、口音、背景干扰等维度对开发集做切片这与仓库中 误差分析章节 的按类别分组统计错误思路一致定位人类占优的子集对每个子集分别测评人类误差与算法误差找出人类正确、算法错误的样本在该子集上重演三种技术采集更优人工标签、做基于直觉的误差分析、以该子集的人类误差作为期望目标判断进展速度如果找不到任何人类明显占优的样本则接受已进入超人类慢速改进区的现实把精力转向方差、系统级或数据分布层面的优化后续章节 第36~43章在不同分布上训练与测试 提供了相关工具箱。六、从仓库结构看本章在全书中的定位在仓库的导航配置_data/docs.yml中第33~35章被归入Comparing to human-level performance与人类表现比较这一节紧随Learning curves学习曲线之后、Training and testing on different distributions不同分布下的训练与测试之前。这一编排顺序是有讲究的第33章 回答为什么——为何要与人相比三理由标签获取、直觉误差分析、期望错误率估计第34章 回答如何定义——哪个人类水平该用作基准医学影像案例本章第35章回答超越之后怎么办——即本文主题。同时误差分解框架最优错误率 / 可避免偏差 / 方差则建立在 第20~22章 的偏差-方差理论之上。也就是说本章是偏差-方差理论与人类基准两条线索在超人类阶段的汇合点。仓库中的页面渲染结构参见_layouts/docs.html与_includes/section_nav.html也表明每个章节页会附带上一页 / 下一页导航读者可以顺着ch33 → ch34 → ch35的顺序连续阅读形成完整的认知闭环。七、实践要点清单总结本章可以直接落地的要点场景是否还能用三种技术标签 / 直觉 / 期望目标典型表现算法总误差低于人类平均值但某子集人类仍占优可以只在该子集上使用含噪语音 8% vs 人类 10%但快语速语音人类更强开发集中存在人类正确处理而算法出错的样本可以逐个样本驱动只要人类对、算法错的样本存在人类也很难识别算法明显出错的样本超人类问题基本不适用电影评分预测、送达时间预测、贷款审批机器已全面超越人类的任务进展通常变慢需转向其他优化维度股市预测、广告选择等结语超越人类表现水平不是项目开发的终点而是一个分水岭它标志着你需要把注意力从全局误差指标转移到子集差异上。只要人类仍在某个数据切片上保持优势第33章的三件套更优标签、人类直觉、期望目标就依然是你最快的推进工具只有当人类自己都无法判断正确答案时快速迭代的窗口才会真正关闭。理解这一点能帮助你和团队在超人类阶段依然保持清醒的优先级判断——这也是 Andrew Ng 在《机器学习训练秘籍》中反复强调的用系统化的误差分析代替直觉猜测这一方法论的自然延伸。赞分享文档教程【免费下载链接】machine-learning-yearning-cnMachine Learning Yearning 中文版 - 《机器学习训练秘籍》 - Andrew Ng 著项目地址https://gitcode.com/gh_mirrors/ma/machine-learning-yearning-cn点击查看免费下载相关推荐cnn-benchmarks项目架构解析模块化设计如何支持多硬件测试cnn benchmarks项目架构解析模块化设计如何支持多硬件测试 cnn benchmarks是一个专注于主流CNN模型性能测试的开源项目通过模块化设计人工智能AI Agent工具调用AI 技能MCP 服务网页爬虫机器学习精要如何超越人类表现水平机器学习精要如何超越人类表现水平 当你的算法在某个任务上已经达到10%的误差而人类专家能做到2%时你该如何继续提升本文将深入探讨机器学习系统超越人类表现文档教程机器学习训练秘籍吴恩达《Machine Learning Yearning》中文版完整指南机器学习训练秘籍吴恩达《Machine Learning Yearning》中文版完整指南 《机器学习训练秘籍》Machine Learning Yearn文档教程上一篇崩坏星穹铁道自动化助手三月七小助手完整使用指南下一篇Salt 修复 cmd.script 配合 bgTrue 时临时脚本被提前删除的竞态问题创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表