数据科学上云入门:Data-Science-For-Beginners 云上数据科学系列第一课
2026/9/12 8:22:24 网站建设 项目流程

数据科学上云入门:Data-Science-For-Beginners 云上数据科学系列第一课

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

云计算正在重塑数据科学的工作方式:从海量数据存储、数据集成、大规模计算,到机器学习模型训练与部署,几乎每一个环节都能在云上完成。本篇文章围绕 Data-Science-For-Beginners 课程体系中"数据科学与云"(Data Science in the Cloud)模块的第一课展开,系统讲解云与云计算的基本概念、公有云/私有云/混合云的区别、IaaS/PaaS/SaaS 三大服务模型,以及数据科学家为何选择云来运行数据科学项目,并剖析两个真实的云上数据科学项目案例。读完本文,你将掌握云上数据科学的基础知识框架,为后续学习低代码/无代码训练模型(第 18 课)与 Azure ML SDK 开发方式(第 19 课)打下坚实基础。

什么是云(The Cloud)?

云,即云计算(Cloud Computing),是通过互联网按需交付、按使用付费(pay-as-you-go)的计算服务,这些服务托管在云基础设施之上。服务范围覆盖存储、数据库、网络、软件、分析以及智能服务等解决方案。换句话说,你不再需要自建机房、购买物理服务器,而是通过网络租用弹性计算资源,按实际用量计费。

对应课程模块总览请参阅 5-Data-Science-In-Cloud/README.md,其中明确指出:处理大数据时,云可能成为"改变游戏规则"的关键因素。

公有云、私有云与混合云

按部署模型,云通常分为三类,课程中给出了如下定义:

  • 公有云(Public Cloud):由第三方云服务提供商拥有并运营,通过互联网向公众交付其计算资源。这是最常见的形态,用户按需租用资源、按用量付费。
  • 私有云(Private Cloud):云计算资源仅被单一企业或组织独占使用,服务与基础设施在私有网络上维护,安全性和可控性更高,但需要自行投入建设和维护成本。
  • 混合云(Hybrid Cloud):结合公有云与私有云的系统。用户可以选择在本地(on-premises)数据中心运行部分业务,同时允许数据和应用程序运行在一个或多个公有云上,兼顾安全合规与弹性扩展。

IaaS、PaaS 与 SaaS 三大服务模型

大多数云服务可归入以下三类:

  • 基础设施即服务(IaaS,Infrastructure as a Service):用户租用 IT 基础设施,例如服务器和虚拟机(VM)、存储、网络、操作系统。用户自行管理操作系统之上的环境,云提供商负责底层硬件。
  • 平台即服务(PaaS,Platform as a Service):用户租用用于开发、测试、交付和管理软件应用的环境。用户无需关心开发所需的底层基础设施(服务器、存储、网络、数据库)的搭建与管理,可专注于应用代码本身。
  • 软件即服务(SaaS,Software as a Service):用户通过互联网按需访问软件应用,通常以订阅方式计费。用户无需关心软件应用的托管、底层基础设施以及维护工作(如软件升级和安全补丁),开箱即用。

课程指出,目前最大的几家云服务提供商包括 Amazon Web Services(AWS)、Google Cloud Platform(GCP)和 Microsoft Azure。它们各自提供覆盖 IaaS、PaaS、SaaS 的完整服务目录,数据科学家可以按项目需求自由组合。

为什么数据科学要选择云?

开发者和 IT 专业人员选择使用云的原因多种多样,课程总结了七大核心驱动力:

驱动力说明
创新(Innovation)将云提供商创建的创新服务直接集成到你的应用中,快速增强应用能力。
灵活性(Flexibility)只为你需要的服务付费,可以从广泛的服务目录中自由选择;通常按用量计费,并能随需求变化调整服务组合。
预算(Budget)无需前期投入购买硬件与软件,也无需搭建和运营本地数据中心,只需为实际使用量付费,把资本支出转化为运营支出。
可扩展性(Scalability)资源可以根据项目需求伸缩:应用随时可增减计算能力、存储和带宽,以适应外部因素(如流量高峰)的变化。
生产力(Productivity)将数据中心运维等可外包的任务交给云厂商,让你专注于业务本身。
可靠性(Reliability)云提供多种持续备份数据的方式,可制定灾难恢复(disaster recovery)计划,确保危机时期业务与服务不中断。
安全性(Security)借助云提供商提供的策略、技术与控制手段,强化项目整体安全水平。

云如何解决数据科学家的具体难题

理解云的普遍价值之后,课程进一步聚焦数据科学家和数据开发者的实际工作场景,给出了五类典型的云应用需求:

  1. 存储海量数据:与其购买、管理和保护大型服务器,不如把数据直接存放在云中,例如 Azure Cosmos DB、Azure SQL Database 和 Azure Data Lake Storage。
  2. 执行数据集成(Data Integration):数据集成是数据科学从"收集数据"迈向"采取行动"的关键环节。借助云上的数据集成服务(如 Azure Data Factory),可以把来自不同来源的数据收集、转换并整合到统一的数据仓库中。
  3. 数据处理(Data Processing):处理海量数据需要大量算力,并非每个人都有足够的本地机器。直接利用云上强大的计算能力来运行和部署解决方案,是很多团队的选择。
  4. 使用数据分析服务:Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks 等服务可帮助把原始数据转化为可执行洞察(actionable insights)。
  5. 使用机器学习与数据智能服务:无需从零开始,可以直接使用云厂商提供的机器学习算法(如 AzureML),还可以使用语音转文字、文字转语音、计算机视觉等认知服务。

课程模块 5-Data-Science-In-Cloud/README.md 展示了这一系列课的完整技术路线:以心力衰竭(Heart Failure)临床数据集为素材,分别用"纯界面操作的低代码/无代码方式"(18-Low-Code)和"Azure ML SDK 方式"(19-Azure)完成模型的训练、部署与消费,云正是这两条路径共同的运行底座。

云上数据科学实战案例

为了让概念落地,课程给出了两个完整的云上数据科学项目案例。

案例一:社交媒体实时情感分析

这是一个机器学习入门者常研究的场景:社交媒体实时情感分析。设想你运营一个新闻媒体网站,想利用实时数据了解读者对哪些内容感兴趣,可以构建一个程序,对 Twitter 上与你读者主题相关的推文执行实时情感分析。

需要关注的关键指标有两个:

  • 特定主题(hashtag)的推文量:衡量话题热度的体积指标;
  • 情感倾向(sentiment):通过分析工具对指定主题的推文内容进行情感判定。

该项目的完整实施步骤为:

  1. 创建事件中心(Event Hub)作为流式输入,负责从 Twitter 收集数据;
  2. 配置并启动 Twitter 客户端应用,用于调用 Twitter Streaming APIs;
  3. 创建 Stream Analytics 作业(job)
  4. 指定作业输入与查询(query)
  5. 创建输出接收器(output sink)并指定作业输出
  6. 启动作业

整体技术栈体现了"云上实时流处理"的经典范式:流数据入口(Event Hub)→ 流式计算引擎(Stream Analytics)→ 结构化输出(输出接收器),全部环节由云服务托管,无需自建消息队列与流处理集群。

案例二:科学论文分析

第二个案例来自本课程体系的作者之一 Dmitry Soshnikov。他构建了一个分析 COVID 论文的工具,能够从海量科学论文中提取知识、获得洞察,帮助研究人员高效地在大型论文集合中导航。其技术步骤如下:

  1. 信息提取与预处理:使用 Text Analytics for Health(健康文本分析服务),从论文中抽取并预处理医学信息;
  2. 并行化处理:使用 Azure ML 将处理过程并行化,大幅缩短批量分析耗时;
  3. 存储与查询:使用 Cosmos DB 存储和查询提取出的信息,支撑灵活的检索需求;
  4. 交互式可视化:使用 Power BI 创建交互式仪表盘,用于数据探索与可视化。

这两个案例分别展示了云在"实时流数据"与"大规模批处理文本"两类场景中的价值:前者依赖事件中心与流分析服务,后者依赖托管机器学习平台、NoSQL 数据库与 BI 可视化工具——它们共同印证了课程结论:云服务可以以多种方式支撑数据科学工作流

课程配套练习:市场调研作业

本课配套有一个"市场调研"(Market Research)作业(见 17-Introduction/assignment.md):课程已介绍多家重要的云服务提供商,作业要求你针对这些厂商开展市场调研,对比它们各自能为数据科学家提供什么能力,评估各家服务是否具有可比性,并撰写一篇论文,介绍至少三家云厂商的数据科学服务及其差异。

评分标准(Rubric)如下:

卓越(Exemplary)合格(Adequate)待改进(Needs Improvement)
一页论文,描述三家云厂商的数据科学服务并区分它们之间的差异呈现了篇幅较短的论文提交了论文但未完成分析

建议调研时从三个维度切入:各家平台的机器学习平台(训练/部署能力)、数据存储与计算服务(数据湖、数据仓库、批处理/流处理)、认知与预训练服务(视觉、语音、NLP),并落到可量化的差异(如计费模式、伸缩上限、生态集成),这与本课正文中"存储、集成、处理、分析、机器学习"五类需求的分析框架一脉相承。

从入门到实操:本课在课程体系中的位置

本课是 5-Data-Science-In-Cloud 模块(共 3 课)的第一课,定位为概念铺垫。后续两课将把本课的云概念落到真实项目:

  • 第 18 课:低代码/无代码方式:在 Azure ML Studio 中通过图形界面完成工作区创建、计算资源(计算实例/计算集群)配置、数据集上传以及 AutoML 自动训练,全程无需编写代码,适合快速验证项目可行性和构建概念验证(POC)。
  • 第 19 课:Azure ML SDK 方式:使用 Python SDK 以代码方式完成相同的流程,包括Workspace.from_config()加载工作区、Experiment管理实验、AmlCompute创建计算集群、AutoMLConfig配置自动机器学习,以及模型注册、AciWebservice部署与 REST 端点消费。

两课对照使用同一个心力衰竭预测数据集(来自 Kaggle,13 列、299 行),其对比表格清晰说明了两种方式的取舍:低代码方式对代码能力无要求、开发快速,但不适合生产环境;SDK 方式需要编程能力,但可以实现从资源创建到模型部署的全流程自动化,具备生产就绪能力。这正是本课所讲"云上存储、算力、机器学习服务"概念的最佳落地注脚——理解云的基础概念,是走进这些实操路径的前提。

小结

本课围绕"为什么数据科学要上云"这一核心问题,完成了三层递进的论述:第一层回答"云是什么"(定义、三种部署模型、三大服务模型);第二层回答"为什么选云"(七大优势与五类数据科学场景);第三层用两个真实案例证明"云能做什么"(实时情感分析、科学论文分析)。作为云上数据科学系列的开篇,它没有涉及任何代码,而是为后续基于 Azure 的低代码与 SDK 实战建立起必要的概念框架。对初学者而言,建议先通过本课的课后小测验检验概念掌握情况,再完成市场调研作业,最后进入第 18、19 课的动手环节,形成"概念 → 对比 → 实操"的完整学习闭环。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询