一文读懂数据科学、机器学习和AI区别在哪里?

AI助手已提取文章相关产品:

原文:What’s the difference between data science, machine learning, and artificial intelligence?
作者:David Robinson
译者: Vincent

译者注:作者是一名数据科学家,每当跟别人提起这项工作,总有人会把它跟人工智能和机器学习弄混淆,那你清楚这三个领域之间有啥区别吗?不妨跟随作者的思路,一起来了解一下吧!以下为译文。

当我跟别人介绍自己是一名数据科学家时,别人总会问我“数据科学与机器学习之间有什么区别?”或者“那你从事的工作一定是跟人工智能有关吧?”关于这些问题我已经回答过了无数次了,每次解释的答案都是基于我自己总结的“三原则”:

相同的代码如果写了3次,那最好把它写成函数

当相同的建议跟别人说了3次,那最好把这些建议写成一篇博客

— David Robinson(@drob)2017年11月9日

这几个领域之间的确存在着很多重叠的地方,但是其实它们之间并不是可互换的:这些领域的大多数专业人士对如何将特定的工作分类为数据科学、机器学习还是分类为人工智能,都有一种直观的见解,即使这种见解很难用语言表达。

所以在这篇文章里面,我将对三个领域之间的差异性做一个简短的定义,该定义如下:

  • 数据科学负责见解
  • 机器学习负责预测
  • 人工智能负责行为

需要清楚的是,这三者之间的限定并不是那么绝对:并不是所有符合每个定义的东西都只属于这个领域。(就像算命先生在做预测,但是他们并不是机器学习!)当然,这些差异也不是确定某个人角色或职位的好方法(“我是数据科学家吗?”),这是跟经验相关的。

但是我认为这个定义是区分这三种工作的有效方法,并且如果谈论三者之间的区别的时候,这个回答听起来也不会很傻。值得注意的是,我使用的是描述性的方法而不是说明性的方法:我对这些术语“应该是什么”并不感兴趣,而是对该领域的人们通常如何使用它们感兴趣。

数据科学负责见解

数据科学与其他两个领域不同,因为它的目标跟人类的目标尤其接近:获得洞察力和理解力。Jeff Leek对数据科学所能达到的见解类型有一个很好的定义,包括描述性,探索性和因果关系。

同样,并不是所有产生见解的东西都有资格成为数据科学(数据科学的经典定义是它包含了统计、软件工程和领域专家的结合)。但是我们可以用这个定义把数据科学同机器学习和人工智能区别出来。它们之间的主要区别在于,在数据科学中,总是有一个人在循环当中:某人理解这个观点,看到数字,或者从结论中获益。说“下棋算法使用数据科学来选择下一步行动”,或者“谷歌地图使用数据科学来推荐驾驶方向”都是毫无意义的。

因此,数据科学的定义强调:

  • 统计推断
  • 数据可视化
  • 实验设计
  • 领域知识
  • 沟通

数据科学家可能使用一些简单的工具:可以报告百分比,并根据SQL查询绘制线形图。还可以使用非常复杂的方法:可能与分布数据商店合作,分析数以万亿计的记录,开发前沿的统计技术,建立交互式可视化。不管使用什么,目的是为了更好地理解数据。

机器学习负责预测

我认为机器学习是一个预测领域:“给定实例X具有特定的特征然后进行预测”。这些预测可能是关于未来的(“预测这个病人是否会进入脓毒症”),但也可能是对于计算机来说并不是很轻易就识别出来的一些特质(“预测这个图像是否有鸟在里面”)。几乎所有的Kaggle竞赛都认为是机器学习的问题:提供一些训练数据,然后看看竞争对手能否对新的例子做出准确的预测。

数据科学和机器学习之间有很多重叠。例如,可以使用逻辑回归得出见解的关系(“富裕的用户更有可能会买我们的产品,所以我们应该改变我们的营销策略”),从而进行预测(“该用户有53%机会购买我们的产品,所以应该把产品推荐给他们”)。

像随机森林这种模型可解释性稍差,更适合“机器学习”的描述,而深度学习等方法则难以解释。如果你的目标是获取真知灼见,而不是做出预测,这可能会妨碍你。因此,我们可以假设有一个数据科学和机器学习的“光谱”,更倾向于数据科学的可解释模型和机器学习方面更多的“黑匣子”模型。

大多数的实践者会在两个任务之间来回切换非常轻松。在我的工作中使用了机器学习和数据科学:我可以在Stack Overflow上安装一个模型,以确定哪些用户可能正在寻找工作(机器学习),然后构建总结和可视化来检验模型的工作原理(数据科学)。 这是发现模型中的缺陷,并与算法偏见作斗争的重要途径。这是数据科学家经常负责开发产品的机器学习组件的原因之一。

人工智能负责行为

人工智能是这三个名称当中迄今为止最古老以及最广为人知的,因此它的定义也是最具有挑战性的。感谢那些寻求金钱或关注的研究人员、记者和初创公司,使得人工智能这一术语被大量的传播和营销。

当你筹集资金的时候,这属于人工智能。

当你在招聘时,这属于机器学习。

当你执行时,这属于线性回归。

调试时,这属于printf()

— Baron Schwartz (@xaprb) 2017年11月15日

在“人工智能”的所有定义中,有一个共同点就是自主代理人执行或推荐操作(例如Poole, Mackworth和Goebel 1998, Russell和Norvig 2003)。一些我认为应该描述为AI的系统包括:

  • 游戏算法(Deep BlueAlphaGo)
  • 机器人技术与控制理论(运动规划,行走两足机器人)
  • 优化(谷歌地图选择路线)
  • 自然语言处理(bots)
  • 强化学习

同样,我们可以看到很多与其他领域的重叠。深度学习既属于机器学习范畴,又属于AI领域,这是非常有趣的。典型的用例是对数据进行训练,然后生成预测,在像AlphaGo这样的博弈算法中已经取得了巨大的成功。

但也有区别。如果我分析一些销售数据并发现特定行业的客户比其他行业的客户更新更多,那么输出是一些数字和图形,而不是特定的操作。(高管们可能会用这些结论来调整销售策略,但这种做法并不是自动的)。

人工智能和机器学习之间的区别更加微妙,历史上的机器学习经常被认为是人工智能的一个分支(特别是计算机视觉,这是一个典型的人工智能问题)。但我认为,机器学习领域很大程度上已经从人工智能独立出来了,部分原因是上面描述的反弹案例:大多数从事预测问题的人不喜欢把自己描述为人工智能研究人员。

根据今天的定义,y=mx+b是一个人工智能机器人,它可以告诉你一条线的去向。

— 艾米Hoy✨(@amyhoy)3月29日,2017年

案例研究:三项技术如何一起使用?

假设正在建造一辆无人驾驶车,现在卡在了停车标志这个具体问题上面。我们需要用到这三个领域之间的相关技术。

  • 机器学习:汽车必须通过摄像头识别停车标志。我们构建了数以百万计的街边物体照片数据集,并训练算法来预测哪些街边是有停车标志。

  • 人工智能:一旦汽车能够识别停车标志,它就需要决定何时采取刹车动作。我们需要它能够根据不同的路况进行判断(例如,在湿滑的路面上要能知道不能刹车刹的太快),太早或太晚都是有危险的,这属于控制理论的范畴。

  • 数据科学:街头测试的结果证明这辆车的性能还不够好,在某些场景下面,它可能沿着停车标志额右边行驶,但是这种情况漏报了。在分析了街道测试数据之后,我们得到了结论,漏报场景的概念根据一天当中不同的时间段有关:在日出之前或日落之后,更有可能错过一个停车标志。我们发现了大部分的数据集里面的数据只包含了白天的物体,因此又构造了一个更好的数据集,它包括了夜间图像,然后重新回到机器学习步骤。


欢迎加入CSDN人工智能技术交流QQ群:299059314,内涵大量学习材料。
这里写图片描述这里写图片描述

您可能感兴趣的与本文相关内容

内容概要:本文围绕“梯级水电+混合式抽水蓄能+源网荷储”多能协同系统开展深入研究,提出一种集成梯级水电站、混合式抽水蓄能电站及风、光等新能源的源网荷储一体化协同优化运行模型,并基于Matlab平台完成仿真代码实现。研究重点在于构建多时间尺度下考虑电力平衡、水量约束、机组运行特性及可再生能源波动性的联合调度机制,通过优化能量流分配提升系统灵活性、运行经济性与可再生能源消纳能力。模型充分考虑梯级水电站间的水力耦合关系与抽水蓄能的双向调节能力,实现对复杂多能源系统的协调控制与综合性能提升。; 适合人群:具备电力系统分析、优化调度及可再生能源并网等相关基础知识,熟练掌握Matlab编程语言,从事水电能源系统、综合能源系统、储能配置与调度优化等领域研究的科研人员与工程技术人员,特别适合高校研究生及以上层次的研究者。; 使用场景及目标:①应用于梯级水电与混合式抽水蓄能电站的联合调度策略设计;②支撑高比例新能源接入背景下电力系统调峰调频与灵活性提升研究;③为源网荷储一体化系统的建模、仿真与优化决策提供可复现的代码框架与技术参考,助力科研成果转化与实际工程应用。; 阅读建议:建议结合文中提供的Matlab代码进行逐模块调试与仿真分析,重点关注目标函数构建、约束条件设置及求解算法实现细节,同时可拓展至不同流域梯级电站与多种储能形式的集成场景,深化对多能协同机理的理解与应用能力。
内容概要:本文系统研究了基于事件触发分布式策略的孤岛微电网二次频率与电压恢复控制方法,旨在通过引入事件触发机制优化通信效率,降低传统周期性通信带来的高开销,同时保障控制性能。研究在Simulink仿真平台上构建了包含多台分布式电源的孤岛微电网模型,实现了频率与电压的协同恢复控制,验证了所提策略在抑制频率电压偏差、提升系统稳定性方面的有效性。文章深入探讨了事件触发条件的设计原理、控制器参数整定方法及系统在外部扰动DoS攻击等复杂环境下的鲁棒性,展现了该策略在提升微电网弹性控制与通信优化方面的潜力。研究成果为分布式控制在智能电网中的应用提供了理论支持与仿真验证范例。; 适合人群:具备电力系统、自动控制或新能源相关背景,从事微电网、分布式控制、智能电网等方向研究的研究生、科研人员及工程技术人员。; 使用场景及目标:①用于孤岛微电网中实现高效、低通信成本的频率与电压协同控制;②为研究事件触发机制在分布式控制中的应用提供仿真案例与技术参考;③支持对二次控制策略、弹性控制、通信优化等课题的深入探索与算法验证。; 阅读建议:建议结合Simulink仿真模型同步学习,重点关注事件触发条件的设计、控制器参数整定及仿真结果分析,宜在掌握基本微电网控制理论基础上进行深入研读与复现实验。
内容概要:本文围绕并网与离网模式下的风光互补制氢合成氨系统,开展容量配置与运行调度的联合优化分析,提出基于Python代码实现的双层优化模型。该模型充分考虑风能与太阳能出力的不确定性,结合电解水制氢及合成氨工艺的能量转换特性,构建涵盖设备选型、容量规划与多时段运行调度的协同优化框架,旨在实现系统在经济性、能源自给率与运行可靠性之间的综合平衡。通过典型场景的仿真分析,验证了模型在不同运行模式下的有效性,深入探讨了系统在离网与并网条件下的最优配置方案、调度策略差异及关键设备的运行特性,为可再生能源深度耦合化工生产过程的综合能源系统规划设计提供了重要的理论依据技术支撑。; 适合人群:具备一定能源系统建模、优化算法及可再生能源技术基础,从事新能源、综合能源系统、氢能与绿色化工等领域的科研人员及工程技术人员,特别适用于研究生及以上学历的研究者。; 使用场景及目标:①研究风光等可再生能源在离网或并网条件下驱动制氢、合成氨系统的最优容量配置与运行调度策略;②掌握基于数学规划(如混合整数线性规划)的能源系统多目标优化建模方法,实现投资成本、运行成本与碳排放的综合优化;③为实际电-氢-氨耦合示范项目的系统设计、经济性评估与运行决策提供仿真工具与量化分析支持。; 阅读建议:建议结合提供的Python代码进行实践操作,重点关注模型的目标函数构建、约束条件(如能量平衡、设备运行特性、电解槽动态响应等)的数学表达与求解器调用流程,宜配合相关专业文献深入理解合成氨反应热力学、电解槽效率模型等关键技术细节,并尝试对不同边界条件(如电价、氢气价格、风光资源禀赋)进行敏感性分析,以深化对系统优化机理的理解。
评论 12
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值