恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
JHU 高管数据科学笔记(三)
首页
资讯中心
/
JHU 高管数据科学笔记(三)
JHU 高管数据科学笔记(三)
发布时间:2026/9/20 14:45:43
在本节课中我们将学习如何解释那些我们不太熟悉的研究效应。核心方法是将未知效应与已知的基准效应进行比较从而获得更直观的理解。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_2.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_3.png概述当我们研究一个全新的或不太熟悉的领域时直接解读效应大小或显著性水平可能非常困难。这些数字本身可能缺乏直观意义。本节将介绍一种解决方案通过将新效应与一个广为人知的基准效应进行对比来帮助我们和他人更好地理解其实际含义。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_5.png问题阐述https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_7.png我们面临的核心数据分析问题是如何解释一个效应或其量级当这个效应来自于一个新研究的构念时解释工作尤其具有挑战性。解决方案与已知构念对比为了解决上述问题我提出的方案是将待研究的效应、P值、效应量或显著性水平与一个已知的构念进行对比。案例分析铅暴露与脑容量为了具体说明这个方法让我们来看一个例子。我的同事布莱恩·施瓦茨发表了一篇论文题为《过去的成人铅暴露与通过脑部MRI测量的神经退行性变相关》。他们的研究发现了一个未经调整的效应估计值骨矿物质每增加1微克铅/克脑容量减少1.41毫升。更简单的理解是铅暴露每增加一个单位脑容量大约减少1.14毫升。这项研究关注的是在铅制造厂工作的人群。研究者担心长期铅暴露会导致脑容量加速下降其速度超过正常衰老过程。那么我们该如何理解这个“-1.14”的效应呢虽然我们给出了单位解释但问题在于我仍然不太清楚这个数字到底意味着什么。引入基准正常衰老将新效应置于相关现象的背景下进行理解这就是我们的核心思路。在这个案例中虽然我不是铅暴露领域的专家但我对正常衰老过程有所了解。已知在40岁以后正常衰老每年会导致脑容量下降约0.5%。这个估算可能略高但大致在这个范围。如果我们取这个“每年0.5%”的下降率并参照布莱恩研究中的平均脑容量数据就可以计算出1.41毫升的减少量大致相当于正常衰老情况下约20%的年下降量。因此我们可以这样重新表述铅暴露每增加一个单位所导致的脑容量损失大约相当于40岁以上人群在一年中经历的正常脑容量损失的20%。方法优势对我而言这个对比后的解释更加清晰。因为我熟悉健康脑衰老领域但不熟悉铅暴露对大脑的影响。通过将陌生的铅暴露效应与熟悉的正常衰老效应进行对比我获得了更深刻的理解。我建议你在分析中尝试使用这种技术当你面对一个复杂的效应度量时将其与你非常熟悉的某个事物进行对比。这是一种非常强大的解释和沟通工具尤其适用于向不同背景的听众解释新概念时。将新构念置于一个房间里所有人都熟悉的框架内能极大地提升沟通效果。这种与基准效应对比的技术在流行病学、公共卫生和生物统计学领域被广泛使用。总结https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/9f658be684d835b89ba6d6a56e6aba36_9.png本节课中我们一起学习了如何通过与基准效应进行比较来更好地解释和理解新研究中的效应。当直接解读效应大小有困难时将其与一个已知的、易于理解的效应如本例中的正常脑衰老进行对比可以化抽象为具体使分析结果更具实际意义和沟通力。065阴性对照 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_0.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_2.png在本节课中我们将学习一种称为“阴性对照”的实用技术。这项技术用于检验统计分析结果的可靠性帮助我们判断一个显著的发现是真实存在的效应还是仅仅由数据处理过程或偶然因素造成的假象。上一节我们讨论了如何评估统计结果的显著性。本节中我们来看看如何通过阴性对照来验证我们的分析过程本身是否可靠。核心问题过程还是真实效应我们担心分析结果更多是由数据处理过程如数据清理、模型选择、算法偏差导致的而非真实存在的内在效应。如何检验这一点呢统计学中的显著性检验等方法虽然能评估数据不确定性但阴性对照提供了一种更贴近数据科学实践的、非常实用的解决方案。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_4.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_5.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_7.png什么是阴性对照阴性对照的核心思想是对一个已知不存在关联的变量重复整个研究分析过程。如果在这个“明知不会有结果”的测试中你的分析过程仍然产出了“显著”的结果那就强烈表明你的分析流程本身存在问题可能会制造出虚假的关联。一个经典案例大脑“连接性”研究让我用一个我所在领域的著名例子来说明。在脑科学研究中“连接性”是一个热门概念它指的是大脑不同区域的活动会相互关联、同步变化。研究者们开发了各种工具来测量这种连接性。有趣的是有研究者将这些工具应用到了大脑的一个特殊区域——脑室。脑室内充满的是脑脊液并没有脑组织。因此理论上脑室内的两个点之间不应该存在由大脑活动驱动的“连接性”。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_9.png然而当研究者使用与分析大脑区域完全相同的技术流程去分析脑室内两个位置的信号时他们竟然发现了“显著”的连接性结果。这个发现非常关键因为它证明了所观察到的“显著关联”并非真实的大脑活动连接而纯粹是分析过程或数据本身的问题所导致的。后续研究发现这主要与两个因素有关头部运动受试者头部移动会在脑室的两个位置产生相似的模式从而造成虚假的相关性。生理噪声呼吸和心跳等生理活动会动态改变信号特征也可能产生伪相关。这个案例的精髓在于研究者通过在一个已知理论上不应有效应的场景下完整复现了备受关注的分析流程并发现了效应从而揭示了原有分析流程中存在的系统性偏差。阴性对照的作用与特点这类阴性对照为调查由混杂因素或多重比较等问题引起的虚假效应提供了一种简单有效的方法。在上述案例中两个体素脑成像的最小单位之间的相关性实际上就被头部运动混杂了。以下是选择一个好的阴性对照变量的关键特征真实性该变量应存在于你的数据集中并经历与目标变量完全相同的处理流程如数据清洗、变换、建模。已知无关联你必须能从逻辑或理论上确信该变量与你的研究结果之间不可能存在真正的因果关系或关联。实施建议与替代方案这是一个简单的技术。如果你对团队成员执行的漫长、复杂的数据整理和分析过程感到不安或者他们构建了多个模型一个很好的检验方法是要求他们针对一个从表面看就绝不可能有关联的变量重复整个分析过程看看会得出什么结果。这是一个极佳的“理智检查”方法可以有效检验过程本身的影响。当然阴性对照的一个常见批评是很难找到百分之百确定不存在任何效应的变量。因此人们也常采用其他策略例如置换检验这是一种更高级的方法通过随机打乱其中一个变量的顺序从而人为地打破变量间可能存在的任何关联然后在多次置换中构建一个“无效应”的零分布用于检验原假设。总结https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_11.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_12.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/e297dc69f6ef8968c62097ce19363462_13.png本节课我们一起学习了阴性对照技术。我们了解到阴性对照是通过对一个已知无关联的变量重复分析流程来检验该流程是否会产生虚假显著结果的有效方法。它像一个“照妖镜”能帮助我们区分一个发现是真实的科学效应还是分析过程制造的幻影。在复杂的数据分析项目中引入阴性对照是提升结果可信度、进行质量控制的实用策略。066非显著性结果解读 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_0.png概述在本节课中我们将探讨当统计检验结果处于“临界”或“模棱两可”状态时应如何解读和处理。我们将重点关注“统计功效”这一核心概念并讨论在结果不显著或接近显著性阈值时研究者应如何思考和行动。临界结果的挑战上一节我们介绍了统计显著性的基本概念。本节中我们来看看当检验结果处于临界状态时的情况。例如你可能会得到一个P值为0.051的结果它略高于0.05的常用显著性阈值。此时结论并非一目了然。面对一个边际效应你最关心的是什么可能有多种情况。以下是几种可能性你只是运气不佳。实际上并不存在效应只是系统中存在一些随机噪声导致你恰好得到一个接近显著或略低于显著水平的P值或假设检验结果。这是一种不幸的情况。另一个我们经常关心的问题是“功效”的概念。即这项研究最初的设计是否真的足以判断效应是否存在理解统计功效在出现模棱两可的结果时你首先要问自己的问题是这项研究是否因为功效不足而注定失败那么什么是功效功效是检测出真实存在的效应的概率。你希望功效越高越好。例如在设计研究时样本量越大的研究功效通常越高。试图检测更大效应的研究功效也越高。这就像看见一头大象比看见一只老鼠更容易。如果真实效应更大就更容易被发现。系统中的噪声越小方差越小你的功效就越高。你所研究的系统不确定性越低你的功效就越高。因此人们经常在研究开始前进行功效计算以确保他们为成功做好了准备确保如果效应确实存在他们有很高的概率能够检测到它。研究后的考量我认为在研究结束后你经常关心的是功效是否充足或者至少应该讨论这项研究是否真的为成功做好了准备。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_2.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_3.png不幸的是事后在功效方面能做的并不多。最显而易见的方法虽然大多数情况下不可行是收集更多数据或进行另一项研究。这显然会有效但这通常超出了你的控制范围。但每个人都曾考虑过一个想法即事后检查功效——利用你观察到的效应进行某种事后功效计算。这通常是个坏主意。如果你这样做你需要在统计学领域非常精通才能理解其中的陷阱。通常所谓的“事后功效计算”是一个糟糕的想法。总的来说试图通过数据来推算你已经完成的研究的功效几乎总是一个坏主意。可行的应对策略如果我们不能收集更多数据或进行另一项研究并且我们已经说过进行某种事后计算来量化功效通常是个坏主意或者如果你打算这样做但了解不多至少应该咨询一位统计学博士而他/她很可能也会试图劝阻你那么我们还能做什么你剩下的唯一途径就是对研究强度进行批判性讨论。这是你的主要应对方法基本上是试图弄清楚我们在这项研究中是否应该看到了一个效应样本量是否与我们看到效应的其他研究相似这种批判性审视是你此刻理解这种模棱两可结果的主要手段。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/2b19daca15dd0e843759733337ed4b74_5.png总结本节课中我们一起学习了如何解读和处理非显著性或临界显著的统计结果。我的主要观点是在面对这类边际结果时你想要进行的主要讨论点之一就是讨论你的研究是否通过具备足够的功效而为成功做好了准备。关键在于理解功效的重要性并在研究设计和结果解读中保持批判性思维而不是依赖于事后的、有缺陷的计算。067相关的估计目标 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_0.png在本节课中我们将学习一个数据分析中非常普遍的情况当你无法直接测量真正关心的目标变量时该如何处理。我们将探讨替代变量的概念、其优缺点以及在实际工作中可以采取的策略。引言无法测量理想就测量现实上一节我们讨论了估计目标的重要性本节中我们来看看当理想的测量目标无法直接获得时我们该怎么办。这引出了“替代变量”的概念。核心思想是如果你无法测量你想要的变量那就测量你能得到的变量。这就像一句老话说的“如果你不能和你爱的人在一起那就爱你身边的人。” 在数据分析中这意味着我们常常需要用替代变量来近似我们真正关心的目标变量。一个不那么鼓舞人心的经典笑话也描绘了类似困境一个醉汉在路灯下找钥匙。警察问他是否在这里丢了钥匙醉汉说“不我丢在那边了”。警察问“那你为什么在这里找”醉汉回答“因为这里有光”。我们希望在使用替代变量时不要像这个醉汉一样仅仅因为“这里有光”数据容易获得就进行搜索而应确保我们的“钥匙”真实洞察就在附近。什么是替代变量在许多调查或研究中直接测量最相关或最理想的指标往往非常困难甚至不可能。这时我们会使用一个更容易测量、但与真实目标相关的变量作为替代。以下是几个经典的替代变量例子身体质量指数作为体脂百分比的替代。BMI仅通过身高和体重计算而精确测量体脂百分比需要更复杂的技术。国内生产总值经济学家常用它作为经济福祉的替代指标尽管他们承认这只是对经济福祉的一种粗略概括。食物频率问卷用于估算卡路里摄入量。通过询问人们上周吃了什么来推断其热量消耗这是一个噪声很大的测量方法但要精确记录人们的饮食数据本身就很困难。选民意向调查询问人们是否会投票得到的是“可能投票者”但这不等于“实际投票者”。网站流量测量的流量可能包含大量网络爬虫如搜索引擎爬虫的访问而非真实的用户访问。功能性磁共振成像在神经科学领域我们真正想测量的是神经元信号但实际得到的是一个名为“血氧水平依赖信号”的粗略代理信号。因此无法测量目标变量只能测量一个相近的替代变量这是一个非常普遍的问题。优秀替代变量的特征 ✅那么一个好的替代变量应该具备哪些特征呢https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_2.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_3.png以下是优秀替代变量的关键特征无偏性即使替代变量有噪声与真实目标变量不完全一致它也不应存在系统性偏差即不会系统地偏大或偏小。理想情况下替代变量围绕真实目标变量的方差是已知的。可校准性在部分样本中能获得真实值金标准从而可以研究和校准替代变量的准确性。一个无偏替代变量的例子是用一个有噪声但无偏的秤测量体重。虽然单次测量不准确但多次测量的平均值会接近真实体重并且你知道其测量误差的分布情况。在这种情况下你可以在分析中使用这些信息。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_5.png然而这种“无偏且方差已知”的情况非常少见。更常见且可实现的是第二种情况进行金标准研究。策略金标准研究与校准 如果你有条件最好的策略之一是在一个子集样本上进行金标准研究。例如在研究智能手环如Fitbit的计步功能时它并非直接测量步数而是测量手腕的加速度并通过算法预测步数。其估算的卡路里消耗则更不直接。一个严谨的研究方法是让受试者在实验室环境中佩戴设备同时使用更精确的方法如代谢面罩直接测量其真实的步数和卡路里消耗。这样你就在这部分样本上获得了“金标准”数据。利用这部分数据你可以评估设备的准确性。建立校准模型预测步数 f(加速度数据)。将这个模型应用到那些只有设备数据、没有金标准数据的大规模样本中。进行金标准研究非常有益。根据科学界的经验当我们深入研究这些替代变量的准确性时常常会惊讶地发现它们比我们想象的要不准确得多。因此如果条件允许强烈建议花时间对你使用的替代变量进行校准研究。当缺乏金标准时承认局限与敏感性分析 ⚠️如果上述策略都不可行即没有金标准数据也无法从外部数据验证那么你必须承认分析的局限性。在这种情况下你需要对结果保持怀疑态度时刻意识到你的结果基于一个有噪声的替代变量。进行敏感性分析评估替代变量的偏差和变异性对结论的影响。敏感性分析是指假设替代变量存在一定程度的误差例如食物频率问卷可能每天平均低估100卡路里的摄入然后将这种误差纳入分析观察你的核心结论是否会因此改变。这是一种“试探”方法用于理解未测量真实目标所带来的后果。何时应该放弃 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_7.png最后我们需要思考什么时候应该放弃使用某个替代变量进行分析一个实用的判断标准是在开始分析或收集数据之前先思考你将如何解释结果。问自己考虑到你使用的替代变量相对于真实目标如此不准确和不可靠是否任何可能的结果无论是你希望看到的还是完全相反的都不会真正改变你的决策或认知状态如果答案是肯定的那么进行这项分析可能就没有意义。在这种情况下你需要改进你的替代变量。设法进行金标准研究。寻找新的、更好的变量。或者直接放弃这个分析方向。在投入成本进行一项分析之前先思考能否从嘈杂的替代变量中获得任何有价值的信息这是非常必要的。总结 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_9.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b9b4eae1349ea1ab3928805667a3404c_10.png本节课我们一起学习了如何处理无法直接测量目标变量的情况。我们介绍了替代变量的概念探讨了优秀替代变量的特征无偏、可校准。我们学习了两种主要策略进行金标准研究以校准替代变量以及在缺乏金标准时通过敏感性分析和保持怀疑态度来评估局限性。最后我们讨论了在替代变量质量过差时应考虑放弃分析转而寻求更好的测量方法。理解并妥善处理替代变量的局限性是做出稳健数据决策的关键一步。068报告写作 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_0.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_2.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_4.png在本节课中我们将学习如何撰写清晰、可复现的数据科学报告。报告写作是数据科学项目中的关键环节但常常存在问题。我们将探讨三个核心策略帮助你或你的团队提升报告质量。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_6.png上一节我们介绍了报告写作的重要性本节中我们来看看提升报告质量的第一项策略检查效应。检查符号、量级与单位一份优质报告的基础是确保其内容的准确性。以下是三个需要重点检查的方面符号检查效应的方向是否符合预期。例如在分析阿尔茨海默症症状与脑容量的关系时我们预期脑容量随症状加重而减少。如果报告中的系数显示为正即脑容量增加这就值得警惕并需要解释。量级将所研究效应的量级与其他已知效应进行比较。例如可以说“由某因素导致的脑容量损失相当于正常衰老十年的损失量”。这有助于读者直观理解效应的大小。单位确保所有效应的单位清晰明确并标注在所有图表坐标轴上。混淆单位可能导致荒谬的结论例如得出人脑每年增长到房屋大小的错误结果。深入理解单位有助于从根本上理解问题。上一节我们讨论了如何确保报告的准确性本节中我们来看看如何让报告更容易被理解。聚焦于解释与可解释性https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_8.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_10.png报告的核心价值在于传达洞见而不仅仅是展示数字。提升解释性的方法如下与已知效应对比这不仅是检查量级的方法也是增强解释力的有力工具。通过对比让陌生的概念变得熟悉。鼓励简约性在模型选择上应崇尚简约原则即使用尽可能简单且不失效的模型。例如如果一个回归模型能达到复杂机器学习算法95%的预测性能那么牺牲5%的性能以换取模型极强的可解释性通常是值得的。在报告中应着重解释回归系数等易于理解的结果。进行效应批判当发现一个显著或令人兴奋的效应时应主动扮演“怀疑者”的角色。思考可能的替代解释或混杂因素。例如发现铅暴露与脑容量损失相关时需质疑“这真的是铅暴露导致的还是暴露组与非暴露组人群的体重指数不同造成的”这种批判性思维将引导你进行更深入的分析例如在模型中同时纳入铅暴露和体重指数以巩固或修正你的结论。上一节我们探讨了如何让报告内容更易于理解本节中我们来看看如何确保报告的分析过程可以被他人验证和复现。使用可复现的研究工具可复现性是现代数据科学的基石。它确保报告中的每一个数字都能被追溯和重新生成。Ben Hammer 有一条精辟的推文“写代码时请记住你是在与未来的自己合作。”为了实现报告的可复现性应鼓励使用将数据分析与报告撰写合二为一的工具。这类工具能自动生成包含所有分析步骤的文档。目前最流行的两种工具是knitr这是一个专门用于R语言的工具其理念是将分析与报告“编织”在一起。Jupyter Notebook这是一个支持多种编程语言如 Python、R的交互式笔记本工具。使用这类工具可以确保报告不仅呈现结果还完整记录了从原始数据到最终分析结果的全部路径。总结https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/46a4e4ffb3e8bcaf3fea101eb468cfe7_12.png本节课中我们一起学习了提升数据科学报告质量的三个核心策略严格检查报告中效应的符号、量级和单位确保基础准确性。聚焦于解释与可解释性通过对比、崇尚简约模型和进行自我批判让报告清晰传达洞见。采用可复现的研究工具如knitr或Jupyter Notebook将分析与报告无缝结合确保结果可被验证和追溯。遵循这些策略将能显著提高报告的专业性、可信度和沟通效率。069版本控制 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_0.png在本节课中我们将要学习版本控制的概念、重要性以及如何在数据分析工作中实践它。版本控制是确保代码可追溯、可协作和可恢复的关键工具。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_2.png上一节我们讨论了撰写可重复报告的重要性。本节中我们来看看如何通过版本控制来管理代码和分析过程的历史记录。记住本课程的核心主题对比现实与理想的数据分析实践。我认为版本控制是少数几个能够轻松达到理想状态的主题之一。它只需要投入少量工作却常常能节省大量时间。请思考这句话当你编写代码时请记住你正在与未来的自己合作。能够查看代码、回溯到之前的版本并了解分析过程的历史是数据分析中极其重要的一环。我们在报告撰写部分讨论过创建可重复报告的重要性。这当然是完成高质量、有良好文档记录的分析的一个组成部分。而持续保存代码的所有版本是另一个关键部分。它不仅有助于备份和归档还能精确记录你所做的每一步这对数据分析目的至关重要。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_4.png总而言之版本控制是一种良好的实践。与本课程中许多其他主题不同它相对容易实现并且完全在你的掌控之中。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_6.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_7.png以下是关于版本控制工具演变的个人经历分享。说到这里我想借此机会“抱怨”一下Roger Pang。我使用版本控制已经很久了。我认为我最早使用的是RCS一个相当古老的版本控制系统然后是CVS。后来有一天Roger Pang走进我的办公室说所有人都在用一个叫Subversion的程序我必须切换因为没人再用CVS了。我抗拒了一段时间。但我想Roger在计算方面几乎总是对的。于是我切换到了Subversion这是一个将我的所有CVS仓库转换为Subversion仓库的巨大工程。然而就在第二天Roger又走进我的办公室说所有人都在用Git我必须停止使用Subversion。于是我又抗拒了很长一段时间坚持使用Subversion。但当我最终切换到Git后我感到非常满意。我注意到Git已经存在了一段时间并且似乎会持续下去至少在可预见的未来不会被下一个版本控制系统取代。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_9.pnghttps://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_10.png上一节我们了解了版本控制工具的演变。本节中我们来看看当前推荐的工具和实践。对于你管理的团队成员你应该鼓励他们在分析中使用Git、Subversion、Mercurial等版本控制工具。为了让你对软件有所了解如果我必须给出一个建议我会推荐Git。Git是版本控制软件。它帮助你完整保存代码和分析文件甚至数据文件的历史记录。你可以回溯到任何时间点或者在回退后再次前进。任何被提交到Git仓库的内容都不会丢失。因此Git是实现版本控制的工具。然后你需要一个地方来托管它。你可以自己搭建。如果你在一家公司公司可能已经部署了版本控制系统。如果你在一家较小的公司你可能需要考虑使用Git托管服务。最流行的托管服务中我最熟悉的两个是GitHub我认为它显然是最大的和Bitbucket。这些不是版本控制工具本身而是托管你代码和文件的地方。本质上它们为你托管Git软件并跟踪你的文件。这些都是极好的工具。我强烈建议将使用Git和版本控制作为最佳实践和管理策略的一部分鼓励甚至要求使用这些工具。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/d0f378807f685b4e8b6d7fdb16f09f04_12.png本节课中我们一起学习了版本控制的核心价值。我们了解到版本控制不仅是与未来自己协作的关键也是确保分析过程可追溯、可恢复的最佳实践。我们回顾了版本控制工具的演变并重点推荐了当前主流的Git工具及其托管服务如GitHub和Bitbucket。作为管理者推动团队采纳版本控制是提升数据分析工作质量和效率的重要一步。070顶点项目欢迎信息 https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_0.png在本节课中我们将介绍《高管数据科学》专项课程的最终环节——顶点项目。我们将概述项目的目标、合作伙伴以及它如何评估你在整个专项课程中所学的管理技能。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_0.png欢迎来到《高管数据科学》顶点项目。此时你已经完成了所有课程。我们希望评估你作为高管管理一个小型数据科学项目的能力。作为高管你可能不会直接参与数据分析或处理具体细节但你很可能需要管理那些执行这些任务的人员。因此在这个顶点项目中我们希望评估你运用专项课程所涵盖主题进行决策的技能。上一节我们介绍了顶点项目的总体目标本节中我们来看看项目的具体合作伙伴和背景。我们与 Zillow 合作设计了本次顶点项目。Zillow 是领先的房地产和租赁市场平台在全美范围内提供关于购房和租房的关键数据。在这个顶点项目中你将管理一个基于 Zillow 在日常运营中经常处理的问题而设计的小型数据科学项目。以下是项目执行过程中的评估方式在整个顶点项目期间我们将评估你的表现并跟踪你的进展观察你如何应对出现的各种挑战。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_2.png我们希望你能享受这次顶点项目的体验并感到从整个专项课程中学有所获。https://github.com/OpenDocCN/dsai-notes-pt3-zh/raw/master/docs/jhu-exe-ds/img/b1386090b7019289a13d65fdc29e562e_2.png我们期待看到你的表现。本节课中我们一起学习了《高管数据科学》顶点项目的引入信息包括其评估目标、与 Zillow 的合作背景以及项目的基本执行框架。