Data Science for Beginners 第20课实战:用 Planetary Computer 数据集完成可持续性数据分析与可视化任务
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本文基于课程Data-Science-For-Beginners第20课(Data Science in the Real World)的芬兰语配套作业 assignment.md,讲解本课程压轴实战的完整流程:借助 Planetary Computer 的 Explorer 免登录界面选取地球科学数据集、构造预置查询并渲染可视化,随后围绕数据集特征、可视化洞见、可持续性影响、局限性与替代可视化方案回答五个核心问题。读完本文,你将能够独立完成一次"从选数据、到查询、到渲染、再到批判性分析"的完整数据可视化工作流,并按三级评分标准自评作业质量,还能通过 Launch Hub 进入 Notebook 对原始数据做交互式二次分析。
任务背景:这是课程收官之作的"真实世界"实战
在第20课中,我们梳理了数据科学在各类真实场景中的应用,并深入研究了与科研、可持续性(sustainability)和数字人文相关的示例。本课作业要求你更深入地探索其中一个示例,并把此前学到的数据可视化与数据分析知识付诸实践,从而从可持续性相关的数据中获得洞见(原文档导语)。
结合第20课的课程正文 README.md 可以补充理解本作业的上下文:
- 课程的可持续性板块以联合国《2030可持续发展议程》为背景,其中包含"保护地球"免受退化和气候变化影响等目标。
- Planetary Computer 正是为这一领域设计的平台:它提供 petabyte 级的地球系统数据(Earth Systems data)及对应的 API 接口,数据由 Azure 托管且免费开放。
- 课程原文还指出(截至 2021 年 9 月)该项目处于 preview 阶段——因此本作业特意设计了"免账号即可完成的 Explorer 主流程 + 需申请账号的 Bonus 进阶流程"两条路径,保证任何学习者都能完成核心部分。
本作业在整个课程中的位置:它是第20课"Data Science in the Real World"中"Tehtävä(作业)"一节的正式任务入口,课程 README 末尾通过 Explore A Planetary Computer Dataset 链接指回英文原版作业,芬兰语版即本文所依据的 assignment.md。
平台简介:Planetary Computer 的四个组成组件
作业指定的平台是 Planetary Computer 项目。按课程正文的说明,该项目面向数据科学家和开发者提供四个组件,分别对应本作业的不同使用阶段:
| 组件 | 作用 | 与本作业的关系 |
|---|---|---|
| Data Catalog(数据目录) | 汇集 petabyte 级地球系统数据,免费、托管于 Azure | 第 2 步要求你浏览目录,弄清每个数据集的用途 |
| Planetary API | 帮助用户在空间(space)与时间(time)两个维度上检索相关数据 | Explorer 的"预置查询"本质上就是面向目录数据的时空过滤 |
| Hub | 为科学家处理大规模地理空间数据集提供受管环境 | Bonus 阶段的 Launch Hub 即在此环境中以 Notebook 打开原始数据 |
| Applications | 展示面向可持续性洞见的用例与工具 | 可作为你设计"替代可视化"时的灵感来源 |
平台提供两条访问路径,对应作业的主流程与加分流程:
- Explorer(免账号):浏览器端界面,可直接选数据集、选查询、选渲染方式,是主流程的唯一必需工具;
- 账号 + Launch Hub(需申请):向平台申请账号并在获批后登录,可把原始数据在 Notebook 中打开做交互式分析,这是 Bonus 阶段的入口。
操作步骤(Steps):Explorer 主流程详解
原文档给出的操作路径如下,共三步:
界面说明:Explorer 界面(见下方截图)让你可以从提供的选项中选择数据集(dataset)、预置查询(preset query,用于过滤数据)和渲染选项(rendering option,用于生成相关可视化)。
- 阅读 Explorer 文档—— 理解各选项的含义。 目的:搞清楚界面里"数据集 / 查询 / 渲染"三类控件分别控制什么,避免在后续步骤中凭猜测操作。
- 浏览数据集目录(Catalog)—— 弄清每个数据集的用途。 目的:在动手之前建立"哪些数据集存在、各自解决什么可持续性问题"的全局认知,为第 3 步的挑选提供依据。
- 使用 Explorer—— 选一个你感兴趣的数据集,选择一个相关查询和一个渲染选项,生成可视化。 目的:产出本作业的分析对象——一个渲染在浏览器中的可视化。
操作要点提示(结合课程正文与作业要求):
- "相关查询"要与你选的数据集匹配——查询的作用是把数据按时间或空间维度过滤,选错查询会导致渲染结果与你的问题无关;
- "渲染选项"决定的是如何呈现数据,它直接决定你能从可视化中得到什么洞见,也会影响后续"局限性"问题的答案;
- 选数据集时优先挑与可持续性目标(如气候变化、森林砍伐等,课程正文点名了这两个方向)相关的主题,这样后续五个问题中关于"对可持续性目标的影响"才容易落到实处。
核心任务(Your Task):五个必答问题的逐条解读
在浏览器中得到渲染结果后,作业要求你研究该可视化并回答以下五个问题(原文档Your Task部分逐条列出)。这五个问题实际上覆盖了"描述 → 解释 → 应用 → 批判 → 改进"的完整分析链条:
- Whatfeaturesdoes the dataset have?(数据集具有哪些特征?)考察的是对数据"结构面"的理解:数据包含哪些变量/图层、空间范围、时间跨度、分辨率等。这是前四问的基础。
- Whatinsightsor results does the visualization provide?(可视化提供了哪些洞见或结果?)考察的是从渲染结果中读出趋势、异常或模式的能力——对应课程第9至12课(数量、分布、比例、关系四类可视化)的读数训练。
- What are theimplicationsof those insights to the sustainability goals of the project?(这些洞见对该项目的可持续性目标有何影响/含义?)把技术发现翻译回业务语言:你的读数如何支撑"保护地球"类的目标?这是本课程强调的"数据服务于决策"的落地环节。
- What are thelimitationsof the visualization (i.e., what insight did you not get?)(该可视化有什么局限性,即你没能获得什么洞见?)刻意训练批判性思维:任何单一视图都会丢失信息,要求你明确指出"缺了什么",而不是笼统说"数据不够多"。
- If you could get the raw data, whatalternative visualizationswould you create, and why?(如果能拿到原始数据,你会做哪些替代可视化,为什么?)这是从"看别人渲染的结果"走向"自己设计方案"的关键一步,也是 Bonus 阶段动手实现的蓝本。
加分阶段(Bonus Points):用 Launch Hub 在 Notebook 中做原始数据分析
加分流程的原文要求分三步:
- 申请账号并在获批后登录——这是进入受管环境(Hub)的前提;
- 使用 Launch Hub 选项把原始数据在 Notebook 中打开,交互式地探索数据,并把你前面设想的替代可视化真正实现出来;
- 分析你自己做的可视化——检查是否获得了先前(在 Explorer 里)缺失的那些洞见。
从作业结构看,Bonus 阶段与主流程构成闭环:第 4、5 问中"没得到的洞见"和"设想的替代可视化",在这里变成可执行的 Notebook 实验;而第 3 步"重新分析自己的可视化"则验证了改进方案是否有效。若账号申请未通过,完成主流程的五问作答即满足核心要求,不受影响。
评分标准(Arviointikriteerit / Rubric)
原文档给出的三级评分表如下(原文档表格的表头分隔符多了一个,此处按三列语义修正):
| 优秀(Erinomainen) | 达标(Riittävä) | 待改进(Parannettavaa) |
|---|---|---|
| 五个核心问题全部作答。学生清晰地识别出当前可视化与替代可视化分别能如何为可持续性目标或结果提供洞见。 | 学生至少对前三个问题给出了详尽回答,显示出对 Explorer 的实际操作经验。 | 学生未回答多个问题,或答案细节不足——表明没有对该项目做出有意义的尝试。 |
自评建议:交作业前对照"优秀"一栏逐条核对——五个问题是否都有实质内容;第 2 问与第 5 问之间是否形成呼应(你看到的洞见是否催生了具体的替代可视化设想);对可持续性目标的讨论是否落到了具体目标而非泛泛而谈。
作业边界说明
- 本作业文档为芬兰语 AI 自动翻译版,文末附有免责声明:该文档使用基于 AI 的翻译服务生成,自动翻译可能包含错误或不准确之处;应以原文语言(英文版作业 assignment.md)为准;关键信息建议使用专业人工翻译。
- 主流程仅需浏览器访问 Explorer,无需任何账号;仅 Bonus 阶段需要申请账号并等待审批。
- 课程正文中提到项目处于 preview 状态(2021 年 9 月),实际功能与入口可能随时间演进,操作时以平台当前界面为准。
小结
本作业是Data-Science-For-Beginners20 课旅程的收官实战:以 Planetary Computer 的真实地球科学数据为对象,完整走一遍"选数据集 → 构造时空查询 → 渲染可视化 → 回答五个分析问题 → (可选)用 Launch Hub 在 Notebook 中做原始数据实验"的工作流。它把课程第 9 至 13 课的可视化方法论、第 14 至 16 课的数据科学生命周期与沟通要求,以及第 20 课的可持续性应用场景压缩进了一个可独立完成、可自评分级的真实任务中。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考