
Data Science For Beginners数据科学生命周期入门——捕获、处理与维护三大核心阶段【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners数据科学并不是一门孤立的学科而是一条环环相扣的流水线从提出业务问题到采集原始数据再到建模分析、传递洞察并持续维护每一个环节都决定最终结果的质量。本文基于 Data-Science-For-Beginners 课程第 14 课位于 4-Data-Science-Lifecycle/14-Introduction系统讲解数据科学生命周期的 5 个阶段并重点深入其中 3 个捕获Capturing、处理Processing与维护Maintenance。学完本文你将理解每个阶段要解决的核心问题、数据科学家在该阶段应自问的关键问题清单并能结合仓库中的 NYC 出租车数据集 与配套 notebook 完成一次真实的捕获阶段数据评估实战练习。数据科学生命周期总览图图片来源Berkeley School of Information数据科学是一个过程生命周期五阶段总览经过前面课程的学习你应当已经意识到数据科学是一个过程而非一次性的任务。这个过程的通用模型可以拆解为 5 个阶段捕获Capturing获取数据并明确要解决的问题与目标处理Processing发现数据中的模式并构建模型分析Analysis确认数据能够回答问题、模型能够解决实际问题沟通Communication向决策者与利益相关方传递分析结论维护Maintenance贯穿全程的数据管理、存储与安全保障其中分析与沟通两个阶段分别由本目录下的 15-analyzing 与 16-communication 两课展开而本课聚焦的是剩余三个核心阶段捕获、处理与维护。值得注意的是从生命周期图中可以看到维护并不是一条直线上的终点而是横亘在捕获与处理之间的持续性活动它贯穿项目始终——这正是初学者最容易忽略的一点。捕获Capturing定义问题与获取数据的双阶段合一捕获是生命周期中最重要的第一阶段因为后续所有阶段都依赖它。它实际上是两个阶段合二为一获取数据与定义需要解决的问题和目标。第一步定义项目目标定义项目目标需要深入理解问题或业务场景。首先要识别并找到需要解决问题的人——他们可能是企业中的利益相关方stakeholders或项目赞助者sponsors他们能够帮助确定谁或什么将从项目中受益他们需要什么、为什么需要一个定义良好的目标应当是可测量、可量化的只有这样才能定义可接受的结果标准。例如仅说提升客户满意度是不够的需要将其量化为将季度净推荐值NPS提升 5 个百分点这类可验证的指标。在此阶段数据科学家应当自问的一组核心问题这个问题之前是否被处理过当时的发现是什么所有参与者是否都理解项目的目的与目标是否存在歧义如何减少歧义项目的约束条件constraints是什么最终结果可能长什么样可用的资源有多少时间、人力、计算能力第二步识别、收集并探索数据目标明确之后下一步是识别、收集并最终探索达成目标所需的数据。在获取数据的环节数据科学家还必须评估数据的数量与质量——这需要一定的数据探索data exploration以确认已获取的数据足以支撑预期结果。围绕数据本身数据科学家应当自问我已经有哪些现成数据这些数据归谁所有存在哪些隐私顾虑我的数据量是否足以解决这个问题这些数据对该问题而言质量是否合格如果从数据中发现了额外信息我们是否应该考虑调整或重新定义目标实战锚点本仓库的 assignment.md 正是为训练捕获阶段技能而设计的任务——它要求你站在一位需要评估数据集的数据科学家立场上判断 data/taxi.csv 能否回答客户的问题详见下文实战演练一节。处理Processing模式发现与机器学习交汇之处处理阶段聚焦于在数据中发现模式以及建模。该阶段使用的部分技术依赖统计方法来揭示模式——对于大型数据集而言靠人工完成这项工作会极其繁琐因此我们依赖计算机来完成繁重的计算以加速整个过程。这一阶段也是数据科学与机器学习产生交汇的地方。正如第一课所学机器学习是构建模型以理解数据的过程模型是数据中变量之间关系的表示帮助人们预测结果。处理阶段常用的三类技术本课以入门课程定位介绍了三类最常见的建模技术它们完整的系统化讲解由配套的 ML For Beginners 课程提供分类Classification将数据组织到类别中以便更高效地使用。典型场景如垃圾邮件识别、图像分类。聚类Clustering将数据划分到相似的组群中。典型场景如客户分群、异常检测。回归Regression确定变量之间的关系以预测或估算数值。典型场景如房价预测、销量预估。这三类技术恰好也构成了本仓库后续课程中分析与建模环节的重要基础读者可以在 15-analyzing 的探索性数据分析EDA部分继续深化学习。维护Maintenance贯穿全程的数据管理、存储与安全如生命周期图所示维护阶段位于捕获与处理之间。维护是在整个项目过程中持续进行的数据管理、存储与安全保障活动应当在项目全周期内始终纳入考量。它又细分为三个子主题数据存储、数据管理与数据安全。存储数据Storing Data数据的存储方式与存储位置会影响存储成本以及数据访问的性能速度。这类决策通常不会由数据科学家单独做出但数据科学家很可能需要根据数据的存储方式来调整自己的工作方式。现代数据存储系统中有两个影响决策的关键维度本地部署on-premisevs 外部部署off-premisevs 公有云 / 私有云本地部署on-premise数据托管和管理在自己拥有的设备上例如自购带硬盘的服务器来存储数据。外部部署off-premise依赖你不拥有的设备例如第三方数据中心。公有云public cloud存储数据的流行选择无需了解数据具体如何存储、存储于何处公有指底层基础设施是统一的、由所有云用户共享。私有云private cloud某些组织有严格的安全策略要求对数据托管设备拥有完全访问权因此会依赖提供独立云服务的私有云。关于数据上云的具体实践可继续学习本仓库的 5-Data-Science-In-Cloud 章节。冷数据cold datavs 热数据hot data训练模型时你可能需要更多训练数据而当模型已经令你满意后还会不断有新数据到来供模型发挥用途。无论哪种情况随着数据积累存储与访问成本都会上升。将**很少被访问的冷数据与频繁访问的热数据**分离是借助硬件或软件服务实现更廉价存储的常用方案。其代价是当确实需要访问冷数据时取回它通常比热数据更耗时。因此冷热分层本质上是一种成本与访问速度的权衡决策。管理数据Managing Data在使用数据的过程中你可能会发现部分数据需要清洗才能构建出准确的模型——这正是 2-Working-With-Data/08-data-preparation 一课所讲的数据准备Data Preparation技术包括格式统一、去重、缺失值处理等。关键要点是当新数据到达时同样需要应用这些清洗流程以保持数据质量的一致性。此外一些项目会使用自动化工具在数据移动到最终位置之前完成清洗cleansing、聚合aggregation与压缩compression例如 Azure Data Factory 就是这类工具的代表。保障数据安全Securing the Data数据安全的核心目标之一是确保数据从业者对收集了什么数据、在什么语境下被使用保持掌控。保持数据安全包括仅将访问权限限制给真正需要它的人遵守本地法律法规遵循道德标准详见 1-Introduction/02-ethics 伦理课团队可以落地实施的具体安全举措确认所有数据均已加密向客户告知其数据的使用方式从项目中移除已离开成员的访问权限仅允许特定项目成员修改数据实战演练处于捕获阶段的 NYC 出租车数据集评估为了将捕获阶段的抽象原则落到实处本课配套了 assignment.md 实战任务。场景如下一位客户请求你的团队调查纽约市出租车客户的季节性消费习惯。他们想知道纽约黄色出租车乘客在冬季还是夏季给司机的小费更多此时你的团队正处于数据科学生命周期的捕获阶段而你负责处理数据集。仓库提供了一份 200 行的黄色出租车行程数据 data/taxi.csv以及一个用于加载数据的 notebook.ipynb。从 notebook 源码看数据加载流程notebook.ipynb 使用 Python 与 pandas 库加载数据核心代码路径如下# 安装 pandas 库 !pip install pandas import pandas as pd path ../../data/taxi.csv # 将 csv 文件加载为 DataFrame df pd.read_csv(path) # 打印整个 DataFrame print(df)运行后输出的 DataFrame 结构为200 行 × 18 列包含以下字段字段含义示例值VendorID供应商编号1.0 / 2.0tpep_pickup_datetime上车时间2019-07-15 16:27:53tpep_dropoff_datetime下车时间2019-07-15 16:44:21passenger_count乘客数1.0 ~ 6.0trip_distance行程距离0.83 ~ 4.79RatecodeID费率代码1.0store_and_fwd_flag存储转发标志NPULocationID / DOLocationID上车/下车地点 ID186 / 233payment_type支付方式1.0现金/ 2.0信用卡fare_amount车费金额4.5 ~ 19.5extra / mta_tax附加费 / MTA 税0.0~3.0 / 0.5tip_amount小费金额0.00 ~ 5.70tolls_amount过路费0.0improvement_surcharge改善附加费0.3total_amount总金额6.96 ~ 28.5congestion_surcharge拥堵附加费0.0 / 2.5观察数据可以发现两个关键事实数据集中同时包含 2019 年 7 月夏季与 2019 年 1 月冬季的行程记录例如首行2019-07-15、末行2019-01-30且存在tip_amount字段——这正是回答冬季还是夏季小费更多问题所必需的两个核心要素。任务要求与评估要点assignment 要求你完成以下三项工作评估该数据集能否帮助回答上述问题——从捕获阶段的问题清单出发数据量是否足够tip_amount是否随季节由tpep_pickup_datetime提取可分组比较样本是否具有代表性浏览 NYC Open Data 目录找出一个可能有助于回答该问题的额外数据集——例如天气数据冬季恶劣天气可能影响小费习惯或节假日日历等。注意此任务强调识别并评估补充数据正是捕获阶段识别、收集、探索数据的完整演练。写出 3 个你希望向客户提出的澄清问题——例如小费是否仅统计信用卡支付记录现金支付无法记录小费冬季与夏季的月份划分标准是什么是否需要控制行程距离、时段等变量数据字段的完整定义可参考数据字典Data Dictionary与行程记录用户指南Trip Record User Guide上述字段描述正是基于仓库中 data/taxi.csv 的真实列头与其在 notebook 中的打印输出归纳而成。挑战对比 TDSP 与 CRISP-DM 两种生命周期数据科学生命周期存在众多版本每个版本的步骤名称与阶段数量可能不同但核心流程基本一致。本课挑战要求你研究两种知名的生命周期模型——团队数据科学流程TDSPTeam Data Science Process与跨行业数据挖掘标准流程CRISP-DM并指出两者之间的 3 个相似点与 3 个不同点团队数据科学流程TDSP跨行业数据挖掘标准流程CRISP-DM对比时可以从以下角度切入阶段的命名方式与数量、业务理解在流程中的位置、迭代反馈机制、部署与运维阶段是否显式存在等。复习与自学习多角色协作视角应用数据科学生命周期涉及多种角色与任务有些团队成员可能专注于某个阶段的特定环节。TDSP 提供了若干资源来说明项目中的角色与任务类型例如TDSP 中的角色与任务阐释数据科学家、数据工程师、项目经理等角色在项目中的分工执行数据科学任务探索、建模与部署演示如何将生命周期落地为具体的探索、建模、部署操作这提醒我们生命周期不仅是一张流程图更是一份团队协作的分工地图。此外本仓库 4-Data-Science-Lifecycle 章节还包含 15-analyzing分析 与 16-communication沟通 两课分别讲解探索性数据分析EDA与结果沟通可与本课形成完整的学习闭环。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考