三家 Hadoop 厂商衰落启示:云大数据是颠覆者吗?

文章探讨了云大数据服务与本地大数据服务的发展情况。云平台虽对本地服务有影响,但Hadoop体系的on prem模式短期内难被替代。企业选择大数据搭建场所的关键因素有数据安全、数据体量和业务预判,云与本地服务各有适用场景,企业可按需选择。

个人观点:如今三家 Hadoop 厂商衰落,很多人在疑惑云大数据会是颠覆者吗?其实云平台的出现确实对本地大数据服务造成了一定影响,但本地大数据厂商也在积极寻求转型和突破,云平台可能是和很好的想法,但是云上的资源调度会使得spark、yarn这种组件水土不服,所以就hadoop体系来说,on prem这种模式未来很长一段时间还是不可能被替换掉的。这三家Hadoop厂商的衰落并不代表整个生态存在问题,更多是这三家厂商商业模式的问题。希望文章能让大家对数据方向有更多的了解,以后形成自己的一些见解。

决定大数据搭建场所的重要因素是什么?

如今,企业大数据搭建地可以在本地、公有云和私有云之间灵活选择,而这一决定的关键因素是数据安全、数据体量和业务预判

随着云计算的逐渐成熟,很多大公司都开始创建高效、灵活的云使用环境,这些环境被部署在服务器、存储和网络资源池中,这类方案通常更具成本效益,可以提高大数据技术和高级分析的投资回报率。

当然,云计算不仅适用于类似 Facebook、Uber 这类的互联网公司,同样适用于传统企业。在此之前,企业内部团队在协作共享、大规模数据传输以及敏捷开发层面均存在不同程度的困难。如果将大数据服务搭建在云端,企业将不再需要专门的研发人员来负责基础分析,还可以更加积极主动地访问、分析和处理最新数据,甚至直接构建可视化分析。

过去几年,云平台大数据服务越来越成熟,单就这一项,主流云厂商可提供的服务列表就达到数十种,本地大数据服务的声音似乎越来越弱,这在 Cloudera 与 Hortonworks 合并之后尤为明显。实际上,云平台大数据服务和本地大数据服务各有其生存空间和适用场景,那么,这场争端的最终决定因素应该是什么?传统企业在选择大数据服务时主要会考虑哪些因素?本地大数据服务的演进方向会是什么样的呢?

InfoQ 将就上述问题展开系列探讨,追踪采访数位行业内云计算和大数据相关方向技术专家,从他们的观点中获取答案。本期采访嘉宾——百分点首席架构师黄伟。

大数据搭建地争端

大数据服务的搭建地到底是选择云端还是本地,抑或兼而有之?这个讨论一直都存在。对此,笔者也曾与某互联网云计算厂商的技术专家进行过沟通,他在谈及此事时表示,因为是技术出身,从来不敢说百分百这种事情,技术的演进趋势总是在不断调整,从端到云再到边缘计算,一定会朝着运算更高效、客户体验更优质的方向发展,最终要看整个计算链路上每个要素的技术发展及成本变化。

2009 年,百分点开始上线个性化推荐业务,自行搭建后端本地大数据平台为客户提供 SaaS 服务;2014 年,百分点基于早期积累的平台技术和产品, 为传统企业客户提供本地化大数据服务,并帮助客户最大程度实现数据效用、创造数据价值。据介绍,百分点目前仍在提供多项 SaaS 业务,因为其技术使用门槛低、扩容方便,对数据量小、安全级别不太高的场景来说是最优选择。

因此,根据多年来在数据智能领域的实践经验,百分点首席架构师黄伟总结,主要有三个因素决定企业如何选择大数据服务:数据安全级别、数据量业务发展预估

数据安全级别

2018 年,无论是互联网公司 Facebook、打车应用 Uber 还是美国信用服务公司 Equifax 都曾爆出客户数据遭到窃取事件,不少国家和组织制定了大数据安全相关法律法规和政策,来推动大数据利用和安全保护。可以说,几乎所有行业都会面对数据安全与数据隐私问题,特别是电商、健康医疗、教育、通讯等需要直接面对 C 端用户群体的领域,对个人隐私和数据安全等问题的处理更加敏感。

传统企业考虑到自身技术能力的不足,都不可避免会选择第三方大数据服务,但也需要具备一定鉴别能力和数据安全的管控能力。

相比较云平台大数据服务,黄伟认为,本地大数据厂商无论是在架构、产品 ,还是操作规范、工作流程中,均加强了对数据安全的全面管控和保证。在数据安全层面,预防优先于弥补,对不少企业而言,数据安全不容出错,不同安全级别对应不同的方案措施,需要做好安全防护。

数据量

云平台初始进入门槛较低,所需成本比本地平台初期建设要低很多,尤其是历史负担较轻(本地原始数据量较小,迁移成本不高)的企业。但是,黄伟表示,随着企业数据规模的增大,云平台使用成本的增幅将大大超过本地平台。对企业而言,必须对数据量增长进行预判,尽早选择合适的大数据解决方案,一旦数据体量达到一定规模,何种迁移方式都需要耗费大量成本。

业务发展预估

在选用平台服务时,企业除了考虑当前的数据安全、数据体量成本,一定还要考虑未来的业务增长空间,从而综合选择服务。随着业务的发展,企业将数据应用到企业运转的各个环节,平台运转高负荷亦会持续,考虑运维、机房、扩容成本,依然是本地自建更划算。当然,企业在发展初期可以选择第三方来提供云服务,但也需要根据数据价值产出来扩充自身技术和运维团队能力,增强对数据的掌控能力,以应对未来业务增长产生的新诉求。

不难看出,云平台和本地大数据服务均有足够的细分市场,成本是这其中很重要的一个因素,且成本与数据体量密切相关。简单来说,小数据量企业更适合云平台大数据服务,大数据量则更适合本地大数据服务。

本地大数据服务的生存空间

现实中也有不少企业选择上云,但不用云供应商提供的大数据服务,这部分企业尤以中型互联网公司居多,他们具备一定技术能力,可以独立搭建云平台大数据服务并进行运维。黄伟认为,这可能还出于对安全和价格等多方考虑。云大数据服务让用户相比 IaaS 与数据更近了一步,因而会让数据安全感降低;在同等数据量增长条件下,云供应商提供的大数据服务价格更贵也可能是一个原因。

对比来看,本地大数据的优势主要还是安全性好、大数据量下成本低,适合大数据体量(高负荷)、高安全性的企业需求;云大数据服务的优势主要是小数据量下成本低(入门门槛低、运维扩容方便),适合小数据体量(低负荷),低安全性需求。云大数据服务一般由互联网寡头提供服务,产品成熟度更高;本地大数据服务在产品成熟度上亦在持续进步。

从客户群体来看,本地大数据服务厂商的客户大多来自于银行、保险、证券、政务、制造等数据敏感型传统企业客户和政府客户;而云厂商大数据服务的客户更多来自于新经济体下的中小企业(新零售、新金融等)。不同的客户群体,大数据服务选择的偏好各有不同。

因此,黄伟认为企业大数据服务的未来会是本地、云平台混合使用,不会有绝对的主流,但是针对特定群体的主流服务已经形成。

采访最后,黄伟综合分析了初创互联网企业、成熟互联网企业和线下传统企业的最优选择:

对初创互联网企业而言,前期业务试错阶段,控制成本、快速验证概念为核心需求,且还未形成一定体量,数据安全亦不是核心矛盾,快速接入云大数据平台是一个较好的选择;

对成熟的互联网企业而言,数据安全已是核心矛盾,加之数据规模较大,自建大数据平台成本较低,选择本地大数据服务厂商为其搭建为最优;

对线下传统企业而言,由于自身业务已运转多年,必然产生和积累了海量数据,大多希望利用这些大数据提高业务效率,综合考虑数据安全、数据体量和未来数据使用场景,绝大多数客户会倾向于选择本地大数据服务。首先是数据安全方面:对这类客户而言,数据安全出现一点问题,就可能决定整个企业的未来走向,亦有部分数据保密级别更高的客户,环境整体与互联网隔离,也会倾向选择更加安全可靠的本地大数据服务;其次是数据体量和未来数据使用场景方面:这类客户不只需要大数据平台的产品和技术,也在持续转变着企业经营思维,拓展业务场景,数据计算的场景繁多,平台运转高负荷亦会持续,自建是最优选择。

存在即合理,不同的技术均有其存在的必要性,经过这几轮探讨(《观点:云大数据服务一定是终极形态吗?》《本地 vs 云:大数据厮杀的最终幸存者会是谁?》),本地大数据服务与云平台大数据服务的适用场景已经非常清晰,企业可以根据自身的业务特点、发展需求和安全级别选择适合自己的方案,当然也可以进行多方选择,对数据进行合理利用。最终,让技术更好得为业务服务,而不是牵制业务发展。

 

转载自:https://www.infoq.cn/article/Lw_DNR4NudHEXLVcLtfo

参考自:https://www.infoq.cn/article/03Zz73AWT0Rcl_Jzhc4y

内容概要:本文针对传统三电平并网逆变器存在的谐波含量高、电网不平衡适应性差及动态响应滞后等问题,提出一种基于有源中点箝位(ANPC)三电平逆变器的一体化并网控制策略。该策略融合双极性倍频脉宽调制(DPWMA)、正负序分离锁相与电网电压前馈控制,构建“精准同步-扰动补偿-优质调制”的三层控制体系。通过ANPC拓扑的损耗均衡与中点电位稳定优势,结合DPWMA调制提升等效开关频率、降低输出谐波,利用正负序分离技术实现不平衡电网下的精确锁相,并引入前馈控制克服传统闭环系统的响应延迟。在稳态、电网不平衡及动态扰动等多种工况下的仿真验证表明,该复合控制策略显著降低了总谐波畸变率,提升了锁相精度、电能质量与动态抗扰能力,增强了系统在复杂电网环境下的运行稳定性与适应性。; 适合人群:电力电子、新能源并网、智能电网及相关领域的科研人员与工程技术人员,具备一定电力系统与控制理论基础的研究者; 使用场景及目标:①应用于新能源发电系统中大功率并网逆变器的设计与优化;②解决电网电压不平衡、突变等复杂工况下的并网稳定性问题;③提升逆变系统动态响应性能与电能质量,适配工业变频、储能系统等高可靠性场景; 阅读建议:建议结合Simulink仿真模型进行实践验证,重点关注DPWMA调制实现、正负序分离算法设计与前馈-反馈复合控制的协同机制,深入理解控制策略在多工况下的适应性与优势。
内容概要:本文围绕“考虑多渗透率电动汽车接入的配电网承载能力评估研究”,基于Matlab代码实现,系统探讨了电动汽车在不同渗透率条件下对配电网的影响,重点评估配电网在大规模电动汽车接入场景下的承载能力。研究融合电力系统仿真技术与现代优化算法,针对电压稳定性、潮流分布、负荷特性等关键指标进行量化分析,并可能引入源网荷储协调机制与二阶锥优化(SOCP)、安全约束机组组合等高级建模方法,以提升评估的精度与实用性,为未来城市电网的规划、扩容与运行提供科学依据和技术支撑。; 适合人群:具备电力系统、电气工程或相关专业背景,熟悉Matlab/Simulink仿真工具,具有一定编程能力和优化理论基础的研究生、科研人员及电力行业工程师。; 使用场景及目标:①开展电动汽车与配电网互动相关的学术研究或毕业设计;②评估城市配电网在电动汽车普及背景下的扩容改造方案;③学习并复现高水平电力系统优化类论文中的核心算法与仿真技术,掌握承载能力评估的建模流程。; 阅读建议:读者应结合所提供的Matlab代码进行实践操作,重点关注模型构建的假设条件、目标函数与约束条件的设计逻辑,并尝试调整电动汽车渗透率、充电模式等关键参数,观察系统响应的变化,从而深入理解配电网承载能力的动态演化规律及其内在机理。
内容概要:本文介绍了一个未发表的原创Simulink仿真模型——光伏储能虚拟同步发电机并网仿真模型,旨在深入研究光伏发电系统、储能装置与电网之间的并网运行特性及其控制策略。该模型融合了光伏、储能与虚拟同步发电机(VSG)技术,有效提升了新能源并网系统的稳定性、灵活性和自主调节能力。文档重点阐述了三类典型需求响应负荷的标准化建模方法以及共享储能机制在提升系统响应能力与运行效率方面的应用。此外,文章还系统梳理了涵盖智能优化算法、机器学习与深度学习、图像处理、路径规划、通信技术、信号处理、电力系统管理等多个前沿科研方向的技术服务内容,展现了其广泛的科研应用潜力和技术支撑能力。; 适合人群:具备一定电力系统、新能源技术或自动化背景,从事科研或工程开发工作的研究生、科研人员及工程师。; 使用场景及目标:①开展光伏储能系统并网特性研究,分析虚拟同步发电机控制策略对电网稳定性的影响;②探索需求响应与共享储能提升电网灵活性的方法;③作为科研项目或课程设计的技术参考,推动新能源并网技术的创新与实践。; 阅读建议:建议读者结合Simulink仿真环境实际操作本模型,深入理解各模块的设计原理与参数设置,并参考文中提供的其他技术资源扩展研究思路。同时关注“荔枝科研社”公众号获取完整资源与技术支持。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值