Data-Science-For-Beginners 云数据科学入门:从云计算基础到云端数据科学实战
2026/9/12 14:23:05 网站建设 项目流程

Data-Science-For-Beginners 云数据科学入门:从云计算基础到云端数据科学实战

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

云计算已成为数据科学落地大规模数据项目的基础设施选择。本文是 Data-Science-For-Beginners 开源课程第 17 课(模块 5"云中的数据科学"第一讲)的完整技术解读,围绕 翻译版原文 与 英文原版 展开:你将系统掌握云计算的三种部署形态与三大服务模型,理解云端运行数据科学项目的七大收益,并通过"实时社交媒体情感分析"与"科学论文分析"两个真实案例,看到云服务如何贯穿数据存储、集成、处理、分析与机器学习全链路,为后续学习低代码/无代码建模与 Azure ML SDK 编程式建模打下基础。

本课配套的草图笔记(Sketchnote),出自课程 sketchnotes 目录

什么是云计算

云计算的定义

云计算(Cloud Computing)是指通过互联网,以**按需付费(pay-as-you-go)**的方式交付一系列托管在基础设施之上的计算服务。这些服务涵盖存储、数据库、网络、软件、数据分析以及智能服务等多种解决方案。其核心特征是:使用者无需自建机房,即可按需租用计算资源,并只为实际使用的部分付费。

云计算的三种部署形态

课程将云按照部署方式区分为公有云、私有云与混合云:

部署形态定义关键特征
公有云(Public cloud)由第三方云服务提供商拥有并运营,通过网络向公众交付计算资源无需自购硬件,弹性按需付费
私有云(Private cloud)由单个企业或组织独占使用的云计算资源,服务和基础设施维护在私有网络上数据隔离性强,适合安全合规要求高的场景
混合云(Hybrid cloud)公有云与私有云相结合的系统,用户在保留本地数据中心的同时,允许数据和应用程序运行在一个或多个公有云上兼顾本地掌控与公有云弹性

云服务的三大模型:IaaS、PaaS 与 SaaS

绝大多数云计算服务可归入三类服务模型:

  • 基础设施即服务(IaaS):用户租用 IT 基础设施,包括服务器、虚拟机(VM)、存储、网络与操作系统。用户拥有对底层资源的最高控制权,适合需要自定义环境的场景。
  • 平台即服务(PaaS):用户租用一个用于开发、测试、交付和管理软件应用的完整环境,无需操心服务器、存储、网络、数据库等底层基础设施的搭建与维护,可专注业务代码本身。
  • 软件即服务(SaaS):用户按需(通常按订阅制)通过网络访问现成的软件应用,无需关心应用的托管、底层基础设施以及软件升级、安全补丁等维护工作。

课程指出,当前规模较大的云服务提供商包括 Amazon Web Services(AWS)、Google Cloud Platform(GCP)与 Microsoft Azure。需要说明的是,本课程系列的后续实践均以 Microsoft Azure 为落地平台(详见 模块 5 总览)。

为什么为数据科学选择云计算

开发者与 IT 专业人员选择云计算通常基于以下七个理由,它们也直接对应数据科学项目的实际诉求:

  • 创新(Innovation):可将云服务商提供的创新服务直接集成进应用,快速为数据产品增添能力,而无需从零研发。
  • 灵活性(Flexibility):只为所需服务付费,按使用量计费,并可根据业务演进随时调整服务组合。
  • 预算(Budget):省去采购硬件软件、搭建并运维本地数据中心的前期投入,实现"为实际使用付费"。
  • 可伸缩性(Scalability):资源随项目需求伸缩,应用可随时增减计算能力、存储与带宽,以应对外部因素变化。
  • 生产力(Productivity):将数据中心管理等可外包事务交给云服务商,让团队聚焦核心业务与数据科学本身。
  • 可靠性(Reliability):云提供多种持续数据备份方式,并可制定灾难恢复计划,保障危机时期业务与服务持续运行。
  • 安全性(Security):借助云服务商提供的策略、技术与控制手段,强化项目的整体安全防护。

云计算如何破解数据科学家的五大难题

在理解云的基础概念后,课程进一步聚焦数据科学家与数据处理开发者的日常工作,说明云服务如何针对性地解决五类典型挑战:

  1. 海量数据存储:无需购买、管理与保护大型服务器,可将数据直接存入云端,例如 Azure Cosmos DB(文档型数据库)、Azure SQL Database(关系型数据库)与 Azure Data Lake Storage(数据湖存储)。
  2. 数据集成:数据集成是数据科学从"收集数据"走向"采取行动"的关键环节。借助云端数据集成服务(如 Azure Data Factory),可以收集、转换并整合来自多源的数据,汇入统一的数据仓库。
  3. 数据处理:处理海量数据需要强大的计算能力,并非所有人都拥有足够强劲的本地机器。许多人选择直接借助云端庞大的算力来运行和部署解决方案。
  4. 数据分析服务:Azure Synapse Analytics、Azure Stream Analytics、Azure Databricks 等云端分析服务,可将原始数据转化为可行动的洞察。
  5. 机器学习与数据智能服务:不必从零实现算法,可直接使用云服务商提供的机器学习服务(如 AzureML);还可调用语音转文本、文本转语音、计算机视觉等认知服务。

云中数据科学实战案例

为了让概念落地,课程给出两个真实场景,展示云服务如何组合成端到端的数据科学方案。

案例一:实时社交媒体情感分析

这是机器学习初学者最常研究的入门场景之一。假设你运营一个新闻网站,希望借助实时数据了解读者可能感兴趣的内容,可以构建一个对 Twitter 上与读者相关的主题进行实时情感分析的程序。

项目的关键指标有两个:特定主题(hashtag)下的推文数量(音量)情感倾向,后者由对指定主题执行情感分析的分析工具得出。构建该项目的主要步骤包括:

  1. 创建用于流式输入的事件中心(Event Hub),负责从 Twitter 收集数据;
  2. 配置并启动一个 Twitter 客户端应用,调用 Twitter Streaming API;
  3. 创建 Stream Analytics 作业;
  4. 指定作业的输入与查询逻辑;
  5. 创建输出接收器(output sink)并指定作业输出;
  6. 启动作业。

该流程对应的技术栈是:Twitter Streaming API → Azure Event Hub → Azure Stream Analytics 作业(含情感分析查询)→ 输出接收器,是一条典型的"流式数据 → 实时分析 → 洞察输出"链路,与本模块后续 第 18 课低代码建模、第 19 课 Azure ML SDK 建模 中"训练—部署—消费"的云端工作流互为补充。

案例二:科学论文分析(COVID 论文)

第二个案例来自本课程作者之一 Dmitry Soshnikov。他构建了一个分析 COVID 相关科学论文的工具,展示如何从海量论文中抽取知识、获得洞察,帮助研究人员高效地在大型文献集合中导航。该项目的技术组合为:

  1. 信息抽取与预处理:使用 Text Analytics for Health(健康文本分析)服务提取并预处理论文信息;
  2. 并行处理:使用 Azure ML 将处理过程并行化;
  3. 存储与查询:使用 Cosmos DB 存储并查询抽取出的信息;
  4. 可视化:使用 Power BI 创建交互式仪表盘,支持数据的探索与可视化。

从存储(Cosmos DB)、计算(Azure ML)、分析(Text Analytics for Health)到可视化(Power BI),这个案例完整演示了"文档型数据 + 认知服务 + 并行计算 + BI 可视化"的云端数据科学范式,与课程 数据/工具 目录中的表格数据(如心脏病、鸟类、蜂蜜等数据集)形成了"结构化数据建模"与"非结构化文本分析"两种应用路径的对照。

本课在课程体系中的定位与后续延伸

本课是模块 5"云中的数据科学"的开篇入门课。从 模块总览 可以看到,接下来的两课将围绕同一份心脏衰竭(Heart Failure)数据集,分别以两种方式完成模型的训练、部署与消费:

  • 第 18 课:低代码/无代码方式 —— 在 Azure ML Studio 中通过图形界面(GUI)与 AutoML 训练并部署模型;
  • 第 19 课:Azure ML SDK 方式 —— 使用 Python 编写代码完成同样的全流程,配套的 notebook.ipynb 中包含了从Workspace.from_config()初始化、创建AmlCompute计算集群、配置AutoMLConfig、提交实验到Model.deploy部署与端点消费的完整可运行代码。

两种方式的取舍从源码中也能直观看出:低代码方式以 GUI 交互为主、无需编程经验、适合快速验证项目可行性与搭建概念验证(POC);而 SDK 方式要求编程能力,但能以代码自动化"从资源创建到模型部署"的全流程,满足生产级要求。

本课程后续两课将沿"低代码/无代码"与"Azure ML SDK"两条路径完成同一个心脏衰竭预测项目

课后实践:云服务商市场调研

本课的作业 Market Research(希腊语版)要求:针对多家主流云服务商开展市场调研,分析各家能为数据科学家提供哪些服务,并比较这些服务是否具有可比性,最终写一篇描述至少三家云服务商数据科学服务方案的文章。评判标准为:能在一页篇幅内描述三家服务商的数据科学服务并指出彼此差异,即达"优秀"水平。这一作业正是对本课"云为何重要、云能提供什么"知识点的实践检验,也可作为读者入门各云平台数据科学生态的起点。

总结

本课作为"云中的数据科学"模块的导论,回答了三个核心问题:云是什么(按需付费的互联网计算服务,分为公有/私有/混合云,对应 IaaS/PaaS/SaaS 三种模型)、为什么用云做数据科学(创新、灵活、控预算、可伸缩、提生产力、高可靠、强安全七大收益,以及解决存储、集成、处理、分析、机器学习五类具体难题)、云上数据科学长什么样(实时情感分析、科学论文分析两个端到端案例)。掌握这些基础后,即可进入 第 18 课 与 第 19 课,亲手在云端完成一个完整的数据科学项目。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询