Data-Science-For-Beginners 第 1 课配套作业解析:用“数据科学四问“拆解真实业务场景
Data-Science-For-Beginners 第 1 课配套作业解析用数据科学四问拆解真实业务场景【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本篇技术指南以 Data-Science-For-Beginners 课程中第 1 课定义数据科学的德语译本作业文档 solution/assignment.md 为主体系统讲解数据科学场景分析作业的作答框架、教育场景完整示例、疫苗接种与生产力场景的思考路径并结合仓库内课程正文、配套 Notebook 与数据文件给出源码级佐证。读完本文你将掌握一套可直接复用的四问分析方法收集什么数据、如何收集、如何存储与规模预估、可得出什么洞察与决策能够针对任意业务领域独立完成此类数据科学场景设计。一、作业背景本作业在课程中的定位本作业是课程第 1 课 Defining Data Science 的两项课后任务之一该课另一项任务是修改文本挖掘 Notebook探索 Big Data 与 Machine Learning 的相关概念。第 1 课的核心是建立数据科学的整体认知数据科学是从结构化与非结构化数据中提取知识、产出可行动洞察actionable insights的科学领域其完整流程可概括为五步数据旅程数据获取Data Acquisition采集原始数据必要时借助 IoT Hub 等缓冲端点数据存储Data Storage根据未来查询方式选择关系型数据库、NoSQL 数据库或数据湖Data Lake数据处理Data Processing将原始数据转换为可用于可视化与模型训练的形式例如用 AI 技术从非结构化数据中提取特征可视化 / 人工洞察Visualization / Human Insights借助多种可视化手段与统计方法验证假设、发现相关性训练预测模型Training a Predictive Model在需要做出数据驱动决策时用机器学习构建预测模型。本作业正是要求学习者把上述流程反向应用到真实业务问题上给定一个现实过程或问题回答数据从哪来、怎么存、能得出什么结论。它检验的是学习者是否真正理解数据科学数据 → 洞察 → 决策的闭环而非仅仅记住概念定义。二、作答框架数据科学四问作业要求对每个问题领域依次思考以下四个问题原文见 德语作业文档序号核心问题对应数据旅程环节1可以收集哪些数据Welche Daten können Sie sammeln?数据获取2如何收集这些数据Wie würden Sie diese Daten sammeln?数据获取 / 数据处理3如何存储数据数据规模预计多大Wie würden Sie die Daten speichern? Wie groß werden die Daten voraussichtlich sein?数据存储4能从数据中获得哪些洞察可据此做出哪些决策Welche Erkenntnisse könnten Sie aus diesen Daten gewinnen? Welche Entscheidungen könnten wir auf Basis der Daten treffen?可视化 / 洞察 / 决策要求是对 3 个不同的问题/过程逐项描述上述每一点并将结果填入五列表格Problembereich问题领域Problem问题Welche Daten sammeln收集哪些数据Wie die Daten speichern如何存储Welche Erkenntnisse/Entscheidungen可得的洞察/决策作业文档给出了三个建议领域教育如何用数据改进学校儿童的教育过程、疫苗接种如何用数据在疫情期间管理疫苗接种、生产力如何用数据保证工作效率。作答时可用自己的领域替换建议领域。三、教育场景完整示例逐列拆解参考解答作业文档为教育领域提供了一行完整的示例答案也是唯一一行目的是让学习者理解每列应填什么。下面按列拆解其设计逻辑。3.1 问题列提出可检验的假设在大学中讲座出勤率通常偏低。我们假设更频繁出席讲座的学生平均而言在考试中表现更好。我们希望通过激励出勤来验证这一假设。一个好的问题列需要同时包含业务痛点出勤率低与可检验的假设出勤与考试成绩正相关。假设的存在意味着后续可以用统计手段验证这正是课程第 4 课 概率与统计 中相关性分析的应用场景。3.2 数据收集列多种采集手段的取舍示例给出两条并行的采集路径教室监控摄像头拍摄的照片利用图像识别统计到场学生追踪学生手机在教室内的蓝牙/Wi-Fi 地址通过设备 MAC 地址出现情况判断出勤。同时指出考试成绩数据已存在于大学数据库中无需重新采集——这是数据科学实践中非常关键的一点先盘点已有数据资产再决定新增采集量避免重复建设。课程正文 Where to get Data 一节系统列举了典型数据来源可为该列提供更丰富的选项IoT 传感器如教室温湿度、购买或访问网站后的问卷调查、用户行为分析、文本情感分析、关键词提取、图像/视频如监控视频用于路况估计、Web 服务器日志、社交网络图等。作答时数据来源越具体、越贴近业务得分越高。3.3 数据存储列非结构化 → 结构化的转换若采用监控摄像头图像则需在课堂上保存少量5–10 张照片非结构化数据再用 AI 识别学生人脸将数据转换为结构化形式。这一列揭示了三层含义存储量预估5–10 张照片/课时数量级很小无需大数据架构即可处理数据类型判断照片属于非结构化数据课程正文 Types of Data 中给出的非结构化示例正是监控摄像头的原始视频流结构化转换原始照片无法直接参与统计分析必须先用 AI人脸识别把照片里有哪些人提取成结构化记录学生 ID × 时间 × 出勤标记才能进入关系型数据库做聚合查询。这正好呼应了课程正文数据旅程第 3 步数据处理的论述面对文本、图像等非结构化数据通常需要借助 AI 技术提取特征将其转换为结构化形式。存储选型上结构化出勤记录可放入关系型数据库用 SQL 查询而原始照片可存放在文件存储或数据湖中课程 2-Working-With-Data 部分会系统讲解关系型数据库、NoSQL 与数据湖的取舍。3.4 洞察与决策列从统计检验到激励行动我们可以计算每位学生的平均出勤数据并检验其与考试成绩之间是否存在相关性相关性将在概率与统计一节详述。为激励出勤可在学校门户发布每周出勤排行榜并在出勤最高者中抽奖。该列同样分两层洞察层用描述性统计平均出勤率与相关性分析回答出勤是否影响成绩这一初始假设。课程第 4 课提供了完整的统计工具链——均值/方差/标准差、中位数与四分位数、箱线图、直方图、正态分布、置信区间等其中Real-world Data一节用棒球运动员体重数据data/SOCR_MLB.tsv演示了如何按角色分组做箱线图并比较组间差异这与按出勤分组比较成绩的思路完全同构。决策层给出可落地的激励动作——每周发布出勤排行榜、对最高出勤者抽奖。这正是课程反复强调的可行动洞察洞察只有转化为具体业务动作才有价值。四、疫苗接种与生产力场景思考路径示范作业文档中疫苗接种与生产力两行留空作为练习交由学习者填写。为帮助理解作答标准下面基于课程正文的数据来源与存储章节示范两套思考路径均为示例性质非仓库既定答案。4.1 疫苗接种场景问题疫情期间如何用数据管理疫苗的分发、接种与效果评估例如确保优先人群覆盖、避免疫苗浪费、监控不良反应。收集哪些数据接种登记记录接种人、时间、剂次、疫苗批次、各区域人口结构与优先等级、疫苗库存与冷链运输数据可由温度传感器等 IoT 设备产生、接种后的不良反应报告、疫情流行数据如仓库 data/COVID 下的时间序列确诊、死亡、康复数据。如何存储接种与库存记录适合关系型数据库结构化、需 SQL 聚合查询不良反应的文本描述、疫苗批次照片等适合非结构化存储若做全国范围覆盖分析可能触及大数据规模需要考虑数据湖与分布式存储方案。洞察与决策计算各区域/人群覆盖率识别覆盖率偏低区域并定向调配疫苗分析冷链温度异常与疫苗报废的关联结合疫情数据评估接种对感染率/重症率的影响据此调整接种优先级与宣传策略。4.2 生产力场景问题如何用数据判断员工或个人的工作效率并找到改进点。收集哪些数据工作日志与 Web 服务器/应用使用日志可用于理解哪些任务耗时最长、任务管理工具中的任务完成时间与周期、日历安排、会议时长与数量、可选的键盘/鼠标活动等行为数据课程正文将行为分析与Web 服务器日志列为典型数据来源正适用于此场景。如何存储日志数据通常是半结构化/非结构化且持续增长适合先进入数据湖或 NoSQL 存储再做加工加工后的统计指标入关系型数据库需预估日志随时间增长带来的存储规模。洞察与决策识别时间黑洞如过多低效会议、对比不同工作方式下的产出差异进而调整工作流程、优化任务分配、设定更合理的排期。这两条示范路径均遵循问题 → 数据来源 → 存储与规模 → 洞察与决策的闭环学习者在自填表格时可对照检查每一列是否都有具体、可执行的答案。五、评分标准解读Vorbildlich / Angemessen / Verbesserungswürdig作业文档末尾的评分表Bewertungskriterien定义了三个等级等级要求Vorbildlich优秀为所有问题领域识别出合理的数据来源、存储方法以及可能的决策/洞察Angemessen合格解决方案的某些方面不够详细、未讨论数据存储但至少描述了 2 个问题领域Verbesserungswürdig需改进仅描述了部分数据解决方案且只考虑 1 个问题领域从中可以提炼出三个核心评分维度覆盖广度是否覆盖全部 3 个领域、环节完整性数据来源、存储、洞察/决策四问是否逐项回答存储环节最容易缺失、具体性数据源与决策是否落地到可执行的细节。对照此标准作答时应优先保证三领域全覆盖、四问不缺项再逐项打磨细节。六、仓库配套资源从作业到实战的延伸路径本作业与仓库内以下资源形成完整学习闭环第 1 课正文 README.md数据定义、数据科学范式经验/理论/计算/数据驱动、数据类型结构化/半结构化/非结构化、数据来源与五步数据旅程是作答四问的理论基础文本挖掘挑战 notebook.ipynb用requests抓取维基百科文本、BeautifulSoup 解析 HTML、RAKE 关键词提取并生成词云完整走了一遍获取 → 转换 → 洞察流程可作为理解数据旅程每一步的可运行范例概率与统计课 04-stats-and-probability相关性、假设检验、均值/中位数/分位数、箱线图等工具用于支撑作业中检验假设、寻找相关性的环节数据处理课 2-Working-With-Data 与可视化课 3-Data-Visualization分别对应存储选型与洞察呈现环节的进阶知识示例数据 data/如棒球运动员数据 SOCR_MLB.tsv、疫情时间序列 data/COVID/可用来为自己的场景设计做简单验证。七、实践建议与常见误区误区一只写收集数据不写存储。评分标准明确将未讨论数据存储作为降级项存储与规模预估第 3 问是硬性要求务必给出存储介质与数量级判断。误区二洞察与决策混为一谈。洞察是从数据中发现了什么如出勤与成绩相关决策是据此采取什么行动如发布排行榜、抽奖激励二者应分开表述并保持因果连贯。误区三数据来源假大空。优先选择可落地的采集手段传感器、摄像头、系统日志、已有数据库并像示例那样考虑哪些数据已经存在、哪些需要新采集。建议一先写假设再设计数据。把问题列写成可检验的假设能让后续数据设计与统计检验有的放矢。建议二善用课程五步数据旅程自检。作答完成后对照获取 → 存储 → 处理 → 可视化/洞察 → 建模核对是否有环节遗漏。通过完成本作业学习者将把数据科学从概念层面落到具体的业务设计层面——这正是 Data-Science-For-Beginners 课程为所有人提供数据科学Data Science for All的入门第一步。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考