资讯详情

Data-Science-For-Beginners 数据科学生命周期全解:从 Capturing 到数据叙事(含课程原文、Pandas 实操与讲义证据)

📅 2026/9/13 20:53:21 | 华诺云谱 👁 阅读
Data-Science-For-Beginners 数据科学生命周期全解:从 Capturing 到数据叙事(含课程原文、Pandas 实操与讲义证据)
Data-Science-For-Beginners 数据科学生命周期全解从 Capturing 到数据叙事含课程原文、Pandas 实操与讲义证据【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners在 microsoft/Data-Science-For-Beginners 课程的第四部分《Data Science Lifecycle》爱沙尼亚语版本为 translations/et/4-Data-Science-Lifecycle/README.md正文标题 Andmeteaduse elutsükkel中课程把数据科学拆解为 capturing、processing、analysis、communication、maintenance 五个阶段并用三节课分别深入其中三个环节。读完本篇你将掌握生命周期各阶段的具体职责与检查清单、用 Pandas 完成探索性数据分析EDA的可复制代码路径以及把分析结果讲成数据故事的五种策略和一套可复用的会议叙事框架。章节骨架一个索引页背后的三节课translations/et/4-Data-Science-Lifecycle/README.md 是本章的入口页其结构与英文原版 4-Data-Science-Lifecycle/README.md 完全对应一句导读在这些课程中你将探索数据科学生命周期的若干方面包括围绕数据的分析与沟通 三个主题链接 致谢课程由 Jalen McGee 和 Jasmine Greenaway 编写。页面末尾还附有一段重要声明该页由 AI 翻译服务 Co-op Translator 自动翻译原文档的英文原版应视为权威来源——因此在阅读爱沙尼亚语版本时建议以英文章节为基准核对术语。三个主题及其对应的仓库路径主题英文原文讲解内容1. IntroductionSissejuhatus4-Data-Science-Lifecycle/14-Introduction/README.md生命周期五阶段总览capturing / processing / maintenance2. AnalyzingAnalüüsimine4-Data-Science-Lifecycle/15-analyzing/README.md探索性数据分析EDAPandas 描述统计、抽样、查询、缺失值探查3. CommunicationKommunikatsioon4-Data-Science-Lifecycle/16-communication/README.md数据沟通与故事讲述受众分类、叙事五步法、Emerson 案例需要说明的是课程原文给出的生命周期五阶段为 capturing、processing、analysis、communication、maintenance其中第 14 课负责前三个环节中的 capturing、processing、maintenance第 15、16 课则分别覆盖 analysis 与 communication三节课合起来构成完整闭环。主题一生命周期入门——Capturing、Processing、Maintenance 三大环节Capturing一个环节里藏着两件事原文14-Introduction/README.md指出capturing 是生命周期中第一个也是最关键的阶段后续阶段全部依赖它。它实际上是两个阶段合二为一获取数据以及定义需要解决的目的与问题。定义项目目标需要对问题有更深的上下文先识别出谁需要被解决这些问题业务利益相关方或项目资助方由此确定受益对象及其原因一个定义良好的目标应当是可度量、可量化的以便界定可接受的结果。数据科学家在 capturing 阶段应自问的问题原文完整列表这个问题以前被人研究过吗发现了什么目的和目标是否被所有相关人员理解存在哪些歧义如何减少歧义约束条件是什么最终结果可能是什么样可用资源有多少时间、人力、算力接着是识别、收集并最终探索达成目标所需的数据。在这一步数据科学家还必须评估数据的数量与质量——需要通过一定的数据探索来确认已获取的数据能够支撑期望的结果。围绕数据本身的问题清单我已经有哪些数据可用这些数据归谁所有有哪些隐私顾虑数据量是否足以解决这个问题数据质量是否满足该问题的要求如果通过这份数据发现了额外信息是否应考虑变更或重新定义目标Processing模式发现与建模的交汇点Processing 阶段聚焦于在数据中发现模式以及建模。原文说明该阶段的许多技术需要借助统计方法来揭示模式面对大数据集这通常是人力难以胜任、必须依赖计算机加速的任务。这也是数据科学与机器学习相交之处机器学习是构建模型来理解数据的过程而模型是对数据中变量间关系的表征用于帮助预测结果。课程原文将该阶段常用技术指向微软 ML-For-Beginners 课程中的三个方向外部课程链接此处从略仅保留课程原文的定义Classification分类把数据组织进类别以便更高效地利用Clustering聚类把数据归入相似的组Regression回归确定变量间关系以预测或外推数值。Maintenance贯穿项目全程的存储、管理与安全从生命周期图中可以看到maintenance 位于 capturing 与 processing 之间但原文强调它其实是一个贯穿项目始终的持续过程——在整个项目周期内管理、存储和保护数据。它包含三个子主题存储数据Storing Data。数据如何存、存在哪里会影响存储成本和访问性能。这类决策通常不是数据科学家独自做出的但存储方式反过来会约束其操作数据的方式。原文列出两类关键维度本地on premisevs 非本地off premisevs 公有/私有云on premise 指在自己的设备如自购服务器和硬盘上托管数据off premise 依赖不属于自己的设备如数据中心公有云是最常见的选择使用者无需了解数据具体存在何处公有意味着底层基础设施由所有使用者共享部分组织有严格安全策略要求对承载数据的设备拥有完全控制权因而采用私有云。课程在第五部分5-Data-Science-In-Cloud继续展开云相关内容。冷数据 vs 热数据训练模型时需要大量训练数据模型上线后还会有新数据持续流入存储与访问成本随数据积累而上升。把很少访问的冷数据与频繁访问的热数据分开存放是更经济的存储方案通过硬件或软件服务实现代价是冷数据的取回时间通常比热数据更长。管理数据Managing Data。工作过程中会发现部分数据需要清洗才能支撑准确建模课程把清洗技术指向第 8 课 data preparation新数据到达后需要执行同样的处理以维持质量一致性。有些项目会在数据落到最终位置之前用自动化工具完成清洗、聚合与压缩原文以 Azure Data Factory 为例。保护数据Securing the Data。数据安全的核心目标之一是确保使用者掌握收集了什么数据、在什么场景下被使用。保持数据安全包括把访问权限限制在真正需要的人身上、遵守当地法律法规、维护伦理标准原文链接到第 2 课 ethics。团队可落地的安全实践清单原文完整列表确认所有数据均已加密向客户提供其数据被如何使用的相关信息移除已离开项目人员的数据访问权限仅允许特定项目成员修改数据。课程挑战对比两种生命周期框架第 14 课的 Challenge 要求读者对比两种业界通用的生命周期模型并各列出 3 点异同Team Data Science ProcessTDSP微软团队的团队数据科学流程CRISP-DM跨行业数据挖掘标准流程Cross-Industry Standard Process for Data Mining。课程给出的自研要点是TDSP 提供了角色与任务的参考文档roles and tasks、执行数据科学任务等可帮助理解在项目的每个阶段谁负责什么。主题二Analyzing——用 Pandas 做探索性数据分析EDA第 15 课15-analyzing/README.md回答一个关键问题capturing 阶段已经拿到了数据怎么确认这份数据真的能回答我们提出的问题答案就是探索性数据分析EDA——一套用来刻画数据特征与内部关系、并为建模做准备的技术。本节内容可以结合仓库内的真实代码与数据完整复现。EDA 的四件工具与对应 Pandas API数据剖析 描述性统计describe()数据剖析data profiling通过描述性统计汇总数据集的整体信息——剖析帮我们理解有什么描述性统计帮我们理解有多少。Pandas 的DataFrame.describe()对数值列输出 count、max、min、mean、std 以及分位数。抽样与查询sample()与query()在大数据集上全量探索非常耗时。抽样让我们用概率与统计对总体做一般性推断——样本越大推断越精确但课程也说明并没有硬性规定必须抽多少。与抽样相对查询让我们主动控制、聚焦于有疑问的数据切片query()允许按条件选出行、获得关于数据的简明答案。可视化探索不必等到数据彻底清洗完才开始画图。探索过程中就有可视化有助于识别模式、关系和数据问题同时可视化是与管理数据无关的人沟通的载体也是回到 capturing 阶段澄清新问题的机会课程把可视化细节指回第 3 部分 3-Data-Visualization。查找不一致与缺失值isna()/isnull()上述方法都能间接发现缺失或不一致的值而 Pandas 提供了直接检查缺失值的函数。原文特别提醒一个容易忽略的点要探索这些值当初为什么会变成这样这直接决定后续采取什么手段修复课程指向第 8 课 data preparation 的清洗流程。结合仓库 notebook 实操emails.csv 的describe()示例本节随课提供 notebook.ipynb其中演示了上述 Pandas 函数在真实数据上的用法。从 notebook 的单元格内容看它加载仓库自带的数据集 data/emails.csv该数据集来自 Kaggle 的邮件垃圾分类数据集每行是一封匿名邮件中若干常见单词的计数import pandas as pd # Loading the dataset path ../../data/emails.csv email_df pd.read_csv(path) # Using Describe on the email dataset print(email_df.describe())执行describe()后notebook 中保存的输出显示了该数据集的规模与分布特征共406 行count 列均为 406.0各单词计数列的均值、标准差、最小值、分位数和最大值一目了然例如the列 mean≈7.02、std≈10.95、max99a列 mean≈57.02、std≈78.87、max843——a列的巨大标准差与长尾正是 EDA 阶段先理解有什么、有多少的典型产出这类高度偏斜的计数列若直接进模型往往需要进一步处理。课堂作业用 EDA 回答真实业务问题第 15 课的作业assignment.md承接第 14 课的 taxi 数据任务提供 assignment.ipynb 与 200 条纽约黄色出租车行程记录2019 年 1 月与 2019 年 7 月要求用本课技术回答三个问题数据中还有哪些因素可能影响小费金额哪些列大概率与回答客户问题无关、可以排除就目前提供的数据看是否存在季节性小费行为的证据仓库中的 data/taxi.csv 即该练习数据实际文件为 201 行含表头正好 200 条行程包含 18 个字段VendorID, tpep_pickup_datetime, tpep_dropoff_datetime, passenger_count, trip_distance, RatecodeID, store_and_fwd_flag, PULocationID, DOLocationID, payment_type, fare_amount, extra, mta_tax, tip_amount, tolls_amount, improvement_surcharge, total_amount, congestion_surcharge。可以看到tip_amount小费、tpep_pickup_datetime上车时间用于区分冬/夏和trip_distance可能影响小费的混杂因素正是回答作业问题所需的关键列这为哪些列不需要的判断提供了直接依据。主题三Communication——把数据讲成故事第 16 课16-communication/README.md是全课程篇幅最长的方法论课程核心命题一句话沟通数据的目的是传递由数据支撑的故事而不仅仅是传递数字——受众更容易记住故事而不是数字。沟通的类型与沟通者的责任课程先给出基础定义沟通就是传递或交换信息发送方communicator希望接收方audience理解。据此区分两种类型单向沟通One-Way发送方把信息送达接收方不寻求反馈——群发/批量邮件、新闻播报、电视广告都是典型在数据场景中如大会演讲、对大群体汇报且之后不会立即提问双向沟通Two-Way所有参与者既是发送方也是接收方接收方给出反馈——日常对话、电话、即时消息在数据场景中如用数据说服少数干系人拍板、或说服团队投入时间构建新东西。作为沟通者你的责任是确保接收方带走了你想要他们带走的信息一个由数据支撑的故事而不仅是数字。课程给出五种策略逐一展开。策略一理解你的受众、渠道与沟通方式课程引用《哈佛商业评论》文章《How to Tell a Story with Data》中 Dell 高管战略师 Jim Stikeleather 的受众五分类Novice新手首次接触该主题但不希望被过度简化Generalist通才了解主题想要概览性理解与主要脉络Managerial管理者需要深入、可操作的细节理解能访问细节Expert专家需要更多探索与发现少讲故事、多细节Executive高管只有时间听取加权概率的要点与结论。受众分类必须与渠道备忘录/邮件还是会议/大会演讲和单向还是双向组合决策。课程给出两个对照场景面对以 Novice 为主的受众 单向沟通时必须先教育、铺垫上下文再讲数据是什么、意味着什么、为什么重要并且因为没有即时提问机会必须聚焦清晰度面对以 Managerial 为主的受众 双向沟通时通常无需教育可以直接进入数据但重点是节奏与控场——当问题把讨论带偏时要主动把对话拉回你的故事主线。策略二以终为始Begin With the End in Mind在开口之前先写下你希望受众带走的 key takeaways随后准备故事素材的每一步都自问这一步如何融入我要讲的故事。课程特别警告Cherry-Picking摘樱桃只讲支持自己论点的、而忽略其他数据是失格的。如果确实存在不支持甚至反驳你结论的数据也要讲出来并向受众坦承为什么在数据不完全支持的情况下我仍坚持这个故事。策略三按真实故事的五幕结构组织传统故事五幕——Exposition、Rising Action、Climax、Falling Action、Denouement更易记的表述是Context, Conflict, Climax, Closure, Conclusion。映射到数据沟通Context背景铺垫确保所有人与你在同一认知起点Conflict冲突为什么需要收集这份数据要解决什么问题Climax高潮数据是什么意味着什么指向什么解决方案Closure收束重述问题与提出的方案Conclusion结论总结关键结论与建议的下一步。策略四用有意义的词句拒绝模糊表达课程用一个直观反例说明问题对同事说用户上手的 long time 很长对方会猜是 1 小时还是 1 周换成用户平均 3 分钟完成注册与上手歧义即消除。模糊用法的三个典型我们度过了impressive了不起的一年——有人理解为营收涨 2%–3%有人理解为涨 50%–60%用户成功率dramatically显著提升——多算显著这项工程需要significant大量投入——多少算大量课程说明模糊词并非完全不可用可以作为引子或收尾的概括但要保证受众能跟上、能理解你的关键结论。策略五善用情绪情绪是故事讲述的关键在数据故事里更重要唤起情绪能促进共情、促使行动、提升记忆度。落地的三种手法证言与个人故事Testimonials Personal Stories采集数据时定量与定性并重若数据偏定量去搜集个体经历来补充数据背后的故事图像Imagery图像让受众把自己代入情境把你希望他们产生的情绪推向前台色彩Color不同颜色唤起不同情绪——蓝色通常关联平和与信任、绿色关联自然与环境、红色关联热情与兴奋、黄色关联乐观与快乐同时注意色彩在不同文化中的含义可能不同。案例研究Emerson 的 30 分钟会议课程用完整的案例演示上述框架配套演示稿见 contenteditable="false">【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。