恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
数据科学生命周期实战指南:从数据采集、处理到维护的完整流程(Data-Science-For-Beginners)
首页
资讯中心
/
数据科学生命周期实战指南:从数据采集、处理到维护的完整流程(Data-Science-For-Beginners)
数据科学生命周期实战指南:从数据采集、处理到维护的完整流程(Data-Science-For-Beginners)
发布时间:2026/9/10 18:31:20
数据科学生命周期实战指南从数据采集、处理到维护的完整流程Data-Science-For-Beginners【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners本文以 Data-Science-For-Beginners 课程体系中「数据科学生命周期」第一课4-Data-Science-Lifecycle/14-Introduction为骨架系统讲解数据科学项目的五大阶段并重点深入「采集Capturing」「处理Processing」「维护Maintenance」三个环节你将掌握如何定义可衡量的项目目标、如何评估数据质量与数量、数据存储的冷热分层与云选型逻辑以及数据管理与安全的基本实践。课程配套的 NYC 出租车数据集作业assignment.md会让你在真实数据上验证这些概念。课程全景数据科学是一个五阶段过程从本课程 1-Introduction/01-defining-data-science 的学习中你应当已经认识到数据科学不是一次性操作而是一个持续迭代的过程。该过程可以拆解为 5 个阶段采集Capturing获取数据并定义需要解决的问题与目标。处理Processing在数据中发现模式并建立模型。分析Analysis确认数据与模型能否回答最初的问题。沟通Communication将结论以可视化与汇报形式传递给相关方。维护Maintenance贯穿全程的数据管理、存储与安全。整个生命周期课程共分三讲本课聚焦采集、处理与维护15-analyzing 讲解探索性数据分析EDA16-communication 讲解结论沟通。你可以从 4-Data-Science-Lifecycle/README.md 查看整体课程导航。上图来源于 Berkeley School of Information 对数据科学生命周期的经典描述。采集Capturing目标定义与数据获取采集阶段是整个生命周期中最关键的一步——后续所有阶段都依赖它。它实际上是两个子步骤的合并获取数据 定义需要解决的问题与目标。先定义目标再谈数据定义项目目标需要深入理解问题或业务背景。首先要识别并接触「需要解决问题的人」他们通常是业务中的利益相关方stakeholders或项目赞助者sponsors。这些人能帮助你确认谁或什么将从该项目中受益他们需要什么以及为什么需要。一个定义良好的目标应当是可测量、可量化的这样才能界定「可接受的结果」。围绕目标定义数据科学家通常会自问以下问题这个问题以前是否有人尝试过发现了什么所有参与方是否都理解了目标与意图是否存在歧义如何减少歧义有哪些约束条件最终结果可能长什么样有多少可用资源时间、人力、算力评估数据的数量与质量目标明确之后接下来是识别、收集并最终探索为达成目标所需的数据。在获取阶段数据科学家还必须评估数据的数量与质量——这需要一定的数据探索以确认所获数据足以支撑期望的结果。针对数据本身数据科学家会提出如下问题我已经有哪些数据可用这些数据归谁所有存在哪些隐私顾虑我拥有的数据量是否足以解决这个问题数据质量对该问题而言是否可接受如果通过数据发现了额外信息是否需要考虑调整或重新定义目标与后续课程的衔接采集阶段遗留的「数据是否足够、质量是否合格」等问题正是 15-analyzing 中探索性数据分析EDA要回答的核心问题——EDA 通过数据画像data profiling、描述性统计如 pandas 的describe()、采样sample()与查询query()等技术来评估数据集。处理Processing模式发现与建模处理阶段聚焦两件事在数据中发现模式以及建模。这一阶段常用的技术需要借助统计方法揭示模式当面对大规模数据集时人工处理将非常繁琐通常依赖计算机完成繁重的计算以加速流程。处理阶段也是数据科学与机器学习交汇的地方。正如第一课所讲机器学习是「构建模型以理解数据」的过程模型是数据中变量之间关系的表示能够帮助预测结果。处理阶段常用的技术在本仓库姊妹课程 ML for Beginners 中均有详细讲解可按下述路线深入学习分类Classification将数据组织进类别以便更高效地使用。聚类Clustering把数据分组为相似群体。回归Regression确定变量之间的关系用于预测或预估数值。与仓库实践的对应本仓库的数据处理基础位于 2-Working-With-Data/07-pythonPython 与 pandas DataFrame 入门和 2-Working-With-Data/08-data-preparation数据清洗与转换。数据准备课程明确指出清洗数据可以带来易用与复用、一致性、模型准确性三方面收益——这与处理阶段的目标高度吻合。维护Maintenance贯穿全程的数据管理细心观察生命周期图可以发现维护阶段位于采集与处理之间。维护是项目全过程中持续进行的「管理、存储与保护数据」的过程应当从项目一开始就纳入考量而非事后补救。数据存储Storing Data「如何存储、存在哪里」的决策会直接影响存储成本与数据访问速度。这类决策通常不由数据科学家单独做出但数据科学家需要根据数据的存储方式来选择自己的工作方式。现代数据存储系统中有几个影响决策的维度本地部署 vs 远程托管 vs 公有云 / 私有云本地On premise在自有设备上托管和管理数据例如自购带硬盘的服务器来存放数据。远程Off premise依赖非自有的设备例如第三方数据中心。公有云Public cloud无需关心数据如何、在哪里存储的流行选择。这里的「公有」指一套统一的基础设施被所有云使用者共享。私有云Private cloud部分组织有严格的安全策略要求对数据托管设备拥有完全访问权因此依赖提供专属云服务的私有云。关于云端数据的具体操作可继续学习本仓库的 5-Data-Science-In-Cloud 系列课程含低代码方案与 Azure 环境。冷数据 vs 热数据训练模型时你可能需要更多训练数据而当模型成熟后也会有新数据不断流入以支撑其运行。无论哪种情况存储与访问成本都会随数据累积而上升。将很少使用的冷数据cold data与频繁访问的热数据hot data分离是借助硬件或软件服务降低存储成本的常用手段。代价是当需要访问冷数据时其检索耗时通常比热数据更长。数据管理Managing Data在数据处理过程中你可能会发现部分数据需要清洗才能构建准确的模型——这就要用到 2-Working-With-Data/08-data-preparation 中讲解的技术处理格式问题、重复项、缺失值等。当新数据到达时也需要同样的处理来维持质量的一致性。有些项目会引入自动化工具在数据被移动到最终位置之前完成清洗cleansing、聚合aggregation与压缩compression。Azure Data Factory 就是这类工具的一个代表它可作为数据编排与 ETL/ELT 流水线把「采集—清洗—落地」的流程自动化。数据安全Securing the Data数据安全的主要目标之一是确保处理数据的人能够掌控「收集了什么」以及「在什么场景下被使用」。保持数据安全涉及将访问权限限制在确实需要的人遵守本地法律法规维持 1-Introduction/02-ethics 中讲解的道德标准问责、透明、公平、可靠与安全、隐私与安全、包容性等原则。一个团队从安全角度通常会做如下事情确认所有数据均已加密向客户提供信息说明其数据如何使用为已离开项目的人员撤销数据访问权限只允许特定项目成员修改数据。动手实践评估数据集采集阶段作业为了把「采集」阶段的概念落到实处本课配备了一份实战作业4-Data-Science-Lifecycle/14-Introduction/assignment.md一位客户请求你的团队调查纽约市出租车乘客的季节性消费习惯核心问题是——纽约黄色出租车乘客在冬季给司机的小费是否比夏季更多你的团队正处于生命周期的「采集」阶段你负责处理数据集。仓库为此提供了配套 Notebooknotebook.ipynb和真实数据文件data/taxi.csv。Notebook 中的加载流程如下# 安装 pandas 库 !pip install pandas import pandas as pd path ../../data/taxi.csv # 相对于 notebook 所在目录的路径 # 将 csv 文件加载为 DataFrame df pd.read_csv(path) # 打印 DataFrame print(df)运行后可以看到数据集包含200 行、18 列字段包括VendorID供应商、tpep_pickup_datetime/tpep_dropoff_datetime上下车时间、passenger_count乘客数、trip_distance里程、RatecodeID、store_and_fwd_flag、PULocationID/DOLocationID上下车地点 ID、payment_type支付方式、fare_amount车费、extra、mta_tax、tip_amount小费、tolls_amount过路费、improvement_surcharge、total_amount、congestion_surcharge拥堵附加费等。作业要求完成以下三步评估该数据集中的数据能否帮助回答「冬季小费是否高于夏季」这一问题——注意tpep_pickup_datetime覆盖了 2019 年 1 月冬与 7 月夏的记录tip_amount字段可直接用于对比但需先评估样本量200 条与字段质量是否足够。探索纽约市开放数据目录识别一个额外的数据集以补充回答该问题例如天气数据——雨雪天气可能影响小费习惯。写出 3 个要问客户的问题以便更清晰地理解问题例如小费口径如何定义是否排除信用卡支付外的记录季节性如何界定。关于字段的详细含义可参考官方数据字典data dictionary与行程记录用户指南数据也完全可以用文本编辑器或 Excel 打开查看。挑战对比 TDSP 与 CRISP-DM 两种生命周期数据科学生命周期存在许多版本——每一步可能有不同的名称、不同的阶段数量但本质上都包含本课提到的相同过程。课程挑战要求你对比两种著名的生命周期模型团队数据科学过程TDSPTeam Data Science Process微软提出的团队协作式数据科学生命周期。跨行业数据挖掘标准过程CRISP-DMCross-industry standard process for data mining由数据科学过程联盟维护的行业通用方法论。请分别找出两者的3 个相似点与 3 个差异点例如阶段划分粒度、是否强调部署与反馈循环、适用的团队规模与行业背景等。| 团队数据科学过程TDSP | 跨行业数据挖掘标准过程CRISP-DM | |--|--| ||| | 图源Microsoft | 图源Data Science Process Alliance |回顾与自主拓展实际应用数据科学生命周期涉及多种角色与任务不同的角色可能聚焦于每个阶段的不同部分。TDSP 提供了一些资源来解释项目中可能出现的角色与任务类型TDSP 中的角色与任务了解数据科学家、数据工程师、项目经理等在生命周期各环节的职责划分。执行数据科学任务探索、建模与部署深入探索阶段、建模阶段与部署阶段的具体执行细节。此外本课配有课前测验与课后测验分别对应生命周期入门与维护主题可在完成阅读后自测掌握程度。小结数据科学生命周期的五个阶段——采集、处理、分析、沟通、维护——构成了数据驱动决策的完整闭环。本课重点强调了三点采集阶段的严谨目标定义与数据质量评估决定项目的成败处理阶段是数据科学与机器学习交汇、模式被转化为模型的关键环节维护阶段存储选型、冷热分层、自动化清洗、安全与合规必须贯穿项目始终而非事后补充。配合仓库中的 NYC 出租车数据 Notebook 与 TDSP/CRISP-DM 对比挑战你可以在真实场景中检验「采集—处理—维护」每一步的判断力。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考