ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

云计算入门指南:Data-Science-For-Beginners 第 17 课带你理解云上数据科学

云计算入门指南:Data-Science-For-Beginners 第 17 课带你理解云上数据科学 云计算入门指南Data-Science-For-Beginners 第 17 课带你理解云上数据科学【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇基于开源课程 Data-Science-For-Beginners10 周 / 20 课面向零基础的数据科学学习课程中数据科学与云计算单元的引入课5-Data-Science-In-Cloud/17-Introduction/README.md撰写。你将系统地掌握云计算的本质定义、公有云/私有云/混合云的划分、IaaS/PaaS/SaaS 三种服务模型理解为什么数据科学项目要上云并通过实时社交媒体情感分析与科学论文分析两个典型场景看清云端数据科学的完整落地路径。插图课程配套视觉笔记 Sketchnote第 17 课Data Science In The Cloud把什么是云计算 → 为什么用云 → 云的类型 → 云上数据科学示例串成了一张图。课程定位一场引导你把数据科学搬到云上的绪论本课是全套 20 课中的第 17 课位于课程第 5 单元数据科学与云计算5-Data-Science-In-Cloud/README.md的开篇位置。该单元共三课本课负责建立概念框架随后的两课则把理论落到动手实践上为什么用云计算做数据科学本课第 17 课云端数据科学Low code/No code低代码/无代码路线云端数据科学Azure ML SDK机器学习 SDK路线。正如单元首页所描述的后续课程将基于一份心脏病发作heart failure临床数据集在云端完成训练 → 部署 → 消费模型的完整闭环分别用纯界面操作低代码/无代码和 Azure ML SDK写代码两种方式实现。因此本课讲解的存储、计算、数据集成、分析与机器学习服务等概念会在后面两课中一一得到代码级印证。什么是云计算Cloud Computing云计算The Cloud / Cloud Computing本质上是通过互联网按需交付各种计算服务服务托管在基础设施之上采用**按使用付费pay-as-you-go**的计费模式。云上交付的服务涵盖存储、数据库、网络、软件、分析以及各类智能服务。课程还点出了现实中三种最常见的云部署形态云的类型定义依据课程原文公有云Public cloud由第三方云服务提供商拥有并运营通过互联网向公众交付其计算资源私有云Private cloud计算资源被单一企业或组织独占使用服务与基础设施维护在私有网络上混合云Hybrid cloud公有云与私有云的结合体用户保留本地on-premises数据中心同时允许数据与应用运行在一个或多个公有云上在这一框架下绝大多数云服务又可以归入三大服务类别category服务模型用户获得什么用户不需要操心什么基础设施即服务IaaS按需租用 IT 基础设施如服务器、虚拟机VM、存储、网络、操作系统自购硬件、自行托管机房平台即服务PaaS租用开发、测试、交付、管理软件应用的整套环境搭建和管理开发所需的服务器、存储、网络、数据库等底层基础设施软件即服务SaaS通过互联网按需、通常按订阅获取软件应用托管与运维软件本身、底层基础设施以及升级、安全补丁等维护工作当前市场上规模较大的云服务提供商包括 Amazon Web ServicesAWS、Google Cloud PlatformGCP与 Microsoft Azure。课程单元首页也明确以 Azure 为演示平台来串联后续两课实践。为什么数据科学要选云七大理由开发者与 IT 从业者选择云通常出于以下七大原因——它们全部指向数据科学项目缺算力、缺存储、缺运维时间的现实痛点创新Innovation可以直接把云厂商构建好的创新服务如认知服务集成进自己的应用不必一切从零开发。灵活性Flexibility服务种类丰富、只为自己需要的服务付费典型按量计费并随需求演进随时调整订阅的服务。预算Budget无需初期大规模投入购买硬件与软件、自建并运维本地数据中心用多少付多少。可扩展性Scalability资源随项目需求弹性伸缩应用可根据外部因素随时增减计算能力、存储与带宽。生产力Productivity把管理数据中心这类可由他人代劳的杂务外包把精力聚焦到业务本身。可靠性Reliability云提供多种持续备份数据的方式并可通过灾难恢复计划在危机时刻保持业务与服务的连续性。安全性Security借助云厂商提供的策略、技术与控制手段为项目加固安全防线。云服务如何逐个击破数据科学家的具体挑战课程进一步把视角收窄到数据科学家与数据开发者的日常工作指出云能在以下五个环节直接提供解决方案海量数据存储不必再自购、自管、自护大型服务器可以直接把数据存进云端例如 Azure Cosmos DB、Azure SQL Database 与 Azure Data Lake Storage。数据集成Data Integration数据集成是数据科学的关键环节帮助你完成从收集数据到采取行动的跃迁。借助云端数据集成服务如 Data Factory可以收集、转换并把来自多种来源的数据整合进统一的数据仓库。数据规模处理处理海量数据需要强大的算力并非人人都有足够强的本地机器因此很多人直接借力云端巨型算力来运行和部署自己的解决方案。数据分析服务借助 Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks 等云端分析服务把数据转化为可行动的洞察actionable insights。机器学习与数据智能服务不必从零起步可直接使用云厂商提供的机器学习算法如 Azure ML也可使用语音转文本、文本转语音、计算机视觉等认知服务。从课程源码结构看这一节实际上为后续两课规划了技术选型地图存储对应数据集上传计算对应 compute instance / compute cluster机器学习对应 AutoML 训练而消费模型则落在部署端点endpoint上。云上数据科学的两个实战示例为了把抽象概念具象化课程给出了两个完整场景。这也对应了本课视觉笔记底部的两块核心应用图例。示例一实时社交媒体情感分析Twitter 情感分析场景设定你运营一家新闻媒体网站想借助实时数据判断读者可能对什么内容感兴趣。于是你构建一个程序对 Twitter 上与读者相关的主题数据做实时情感分析。需要观测的两个关键指标是特定话题话题标签 hashtag上的推文量以及通过分析工具围绕指定话题计算得到的情感倾向sentiment。课程列出了搭建该项目所需的六个步骤创建用于流式输入的Event Hub事件中心负责从 Twitter 收集数据配置并启动一个Twitter 客户端应用调用 Twitter Streaming APIs创建一个Stream Analytics 作业指定作业的输入input与查询query创建**输出接收器output sink**并指定作业输出启动作业。可以看到一条完整的实时数据管道摄取 → 流式处理 → 输出完全由云服务编排无需自建任何常驻服务器。示例二科学论文分析COVID 论文知识提取第二个示例来自本课程作者之一 Dmitry Soshnikov 的真实项目一个分析 COVID 相关科学论文的工具。该工具从论文中抽取知识、获得洞察帮助研究者在大规模论文集合中高效导航。它的关键环节同样全部由云服务承担提取与预处理使用 Text Analytics for Health文本分析-医疗健康服务抽取并预处理论文信息并行化处理使用 Azure ML 对处理过程进行并行化存储与查询使用 Cosmos DB 存储并查询信息可视化探索使用 Power BI 创建交互式仪表板供研究者做数据探索与可视化。两个示例的共同点很明显数据摄取、流式/批式处理、信息抽取、存储、机器学习与可视化——这些数据科学工作流的标准环节逐一对应着云平台上的托管服务。这也正是为什么云适合数据科学最直接的论证。在本仓库继续实战概念如何落到代码与界面本课是概念课但仓库里紧邻的课程资源就是它的实践续篇。如果你想在本仓库内进一步验证上述概念可以沿以下路径继续心脏病预测项目全貌与数据来源说明见单元首页 5-Data-Science-In-Cloud/README.md低代码/无代码路线Azure ML Studio、AutoML 界面、模型部署与端点消费见 5-Data-Science-In-Cloud/18-Low-Code/README.md。该课明确对比了两条路线的取舍低代码/无代码上手门槛低、适合快速验证项目可行性和做概念验证POC而一旦项目要走向生产就必须用 SDK 把资源创建到模型部署的每个环节程序化、自动化SDK 路线见 5-Data-Science-In-Cloud/19-Azure/README.md配套代码即 notebook.ipynb 与 solution 目录。SDK 一课恰好回扣本课云计算即按需租用计算资源的定义。例如创建实验、租用计算集群的代码from azureml.core import Workspace, Experiment ws Workspace.from_config() # 从配置文件加载工作区 experiment Experiment(ws, aml-experiment) # 按名称获取或创建实验 from azureml.core.compute import AmlCompute aml_name heart-f-cluster aml_config AmlCompute.provisioning_configuration(vm_sizeStandard_D2_v2, min_nodes1, max_nodes3) aml_compute AmlCompute.create(ws, nameaml_name, provisioning_configurationaml_config)其中计算集群按需从 1 个节点扩展到 3 个节点、用完即释放的配置正是本课所述可扩展性与按需付费在源码层面的体现。再如 AutoML 训练配置中对experiment_timeout_minutes实验自动停止的分钟上限、max_concurrent_iterations最大并发迭代数、taskclassification任务类型等参数的设置也印证了直接使用云厂商提供的机器学习算法、从云端获得可扩展算力这一理念。学习巩固Market Research市场调研作业本课的课后作业是一份调研型任务要求你货比三家。任务说明详见课程作业文件 5-Data-Science-In-Cloud/17-Introduction/assignment.md要点如下作业要求本课提到多家重要的云服务提供商。请你做一次市场调研弄清楚各家能为数据科学家提供什么能力各家服务是否具有可比性并撰写一篇短文描述三家或以上云厂商的数据科学服务。评分标准Rubric优秀Exemplary合格Adequate待改进Needs Improvement一页纸的短文描述了三家云厂商的数据科学服务并指出它们之间的差异提交了篇幅更短的短文提交了短文但缺少必要的分析这份作业的设计思路与本课正文完全一致——先建立云是什么、云能带来什么的通用框架再用横向对比的方式把抽象概念落到具体厂商的真实服务上为后续两课在 Azure 上的动手实验打好选型与理解的基础。小结本课作为数据科学与云计算单元的开篇为你铺好了三块认知基石云计算的定义与按需付费本质、公有云/私有云/混合云与 IaaS/PaaS/SaaS 的划分、以及云在存储、数据集成、规模处理、分析与机器学习等环节对数据科学的具体价值。两个贴近现实的示例实时 Twitter 情感分析、COVID 论文知识提取则展示了这些能力如何被组装成真实系统。读懂本课之后你就可以放心地进入仓库中第 18、19 课亲手在云端完成一次从数据到模型的完整训练与部署。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表