HIVE,SparkSql和Presto对比

限时加码!20+主流AI编程工具免费用 购周边加赠Coding Plan Lite,Claude Code、Cursor等即刻畅享,学习进阶更高效! 阅读详情

HIVE,SparkSql和Presto对比

HIVE

hive是基于Hadoop的一个数据仓库工具,用来进行数据提取、转化、加载,这是一种可以存储、查询和分析存储在Hadoop中的大规模数据的机制。hive数据仓库工具能将结构化的数据文件映射为一张数据库表,并提供SQL查询功能,能将SQL语句转变成MapReduce任务来执行。Hive的优点是学习成本低,可以通过类似SQL语句实现快速MapReduce统计,使MapReduce变得更加简单,而不必开发专门的MapReduce应用程序。hive十分适合对数据仓库进行统计分析。

SparkSql

Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎。Spark是UC Berkeley AMP lab (加州大学伯克利分校的AMP实验室)所开源的类Hadoop MapReduce的通用并行框架,Spark,拥有Hadoop MapReduce所具有的优点;但不同于MapReduce的是——Job中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法。

Presto

Presto是Facebook开发的数据查询引擎,可对250PB以上的数据进行快速地交互式分析。

对比目前流行的几个大数据查询引擎:HiveSparkSQLPresto、Impala、HAWQ、 ClickHouse、Greenplum。 数据仓库 阅读详情

相关推荐

【分布式机器学习】spark环境在线运行平台Databricks

登录页面https://community.cloud.databricks.com/?o=588140745259459#,需要注册并申请免费试用 是一个类似jupyter notebook的平台 点击create→Notebook→输入project的名称,选择语言→创建成功 下面就可以在spark环境中编写自己的project了 点击workspace可以看到目前已创建的projects 简直是神器啊xdm!!! ...

strawcherry_wj的博客 4776

深度解析:Spark、HivePresto 的融合应用之道

Spark作为一个强大的分布式计算引擎,支持多种部署模式,包括Standalone、YARN、MesosKubernetes等集群管理器,可以根据不同场景灵活选择。随着数据量的增长分析需求的多样化,从Spark部署、Hive集成到Presto查询引擎的引入,构成了一个完整而强大的大数据技术栈。这三项技术相互补充,各司其职:Spark负责强大的分布式计算,Hive提供数据仓库管理能力,而Presto则带来高性能的交互式查询体验。

数据与算法架构提升之路专栏 996

Presto、Spark Hive 即席查询性能对比

Spark 则是一个基于内存的分布式计算框架,可以快速地处理大规模的数据,并且具有很高的可扩展性。Presto 可以很容易地集成到现有的数据架构中,并且可以在不同的数据源之间进行无缝的查询。它们都具有各自的优缺点,在不同的场景下都有着不同的应用价值。Spark 是一个基于内存的分布式计算框架,它可以处理大规模的数据,并且具有很高的性能可扩展性。Hive 是一个基于 Hadoop数据仓库系统,它可以将结构化的数据映射到 Hadoop 的文件系统上,并且可以通过 SQL 查询语言进行查询。

GP0000968523的专栏 3438

Spark大数据平台

  Apache Spark 是专为大规模数据处理而设计的快速通用的计算引擎。Spark是UC Berkeley AMP lab (加州大学伯克利分校的AMP实验室)所开源的类Hadoop MapReduce的通用并行框架,Spark,拥有Hadoop MapReduce所具有的优点;但不同于MapReduce的是——Job中间输出结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的MapReduce的算法   Spark 是在 Scala 语言中实现的

晴天的博客 588

比较Hive,Spark,ImpalaPresto (转载)简单了解它们都是干什么的而已(转载)

原文地址:如何比较Hive,Spark,ImpalaPresto? - 知乎 原文的翻译多少有点瑕疵 Spark,Hive,ImpalaPresto是基于SQL的引擎,Impala由Cloudera开发交付。在选择这些数据库来管理数据库时,许多Hadoop用户会感到困惑。Presto是一个开放源代码的分布式SQL查询引擎,旨在运行甚至PB级的SQL查询,它是由Facebook人设计的。 Spark SQL是一个分布式内存计算引擎,它的内存处理能力很高。Hive也由Apache作为查询引擎...

zy103118的博客 2061

HiveSparksqlPresto、Impala、Hawq、Clickhouse、Greenplum大数据查询引擎对比

导读 现在大数据组件非常多,众说不一,在每个企业不同的使用场景里究竟应该使用哪个引擎呢?这是易观Spark实战营出品的开源Olap引擎测评报告,团队选取了HiveSparksqlPresto、Impala、Hawq、Clickhouse、Greenplum大数据查询引擎,在原生推荐配置情况下,在不同场景下做一次横向对比,供大家参考。   每年易观都会发布一次这样的大数据开源测评报告,欢迎...

窗外的屋檐 1万+

presto搭建以及impala,sparksql对比

presto : coordinator + woker Coordinator: 1.用来解析语句,执行计划分析管理Presto的worker结点。 Presto安装必须有一个Coordinator多个worker。 如果用于开发环境测试,则一个Presto实例可以同时担任这两个角色。 2.Coordinator跟踪每个work的活动情况并协调查询语句的执行。 Coordinator为...

webpetter的博客 1794

Spark SQL presto 访问数据源的对比分析

直观感受是使用Spark SQL比通过 presto 写SQL的查询速度更快 开发python程序访问Presto可以借助pyhive工具 文章目录Spark SQL是什么?Hive的不同三种数据结构DataframeDataset是什么Datafram比RDD的优势Dataset比Dataframe的优势presto是什么优点数据模型架构数据库架构设计 Spark SQL 是什么? Sp...

大数据AI笔记 2495

presto、druid、sparkSQL、kylin的对比分析

开源的OLAP引擎,按照查询类型划分,OLAP一般分为即席查询固化查询。 即席查询:通过手写sql完成一些临时的数据分析需求,这类sql形式多变、逻辑复杂,对查询时间没有严格要求固化查询:指的是一些固化下来的取数、看数需求,通过数据产品的形式提供给用户,从而提高数据分析运营的效率。这类的sql固定模式,对响应时间有较高要求。 按照架构实现划分,主流的OLAP引擎主要有下面三点: MP...

liinux-Talk is cheap,show me the code. 620

开源OLAP引擎测评报告-HiveSparksqlPresto、Impala、Hawq等对比

导读 现在大数据组件非常多,众说不一,在每个企业不同的使用场景里究竟应该使用哪个引擎呢?这是易观Spark实战营出品的开源Olap引擎测评报告,团队选取了HiveSparksqlPresto、Impala、Hawq、Clickhouse、Greenplum大数据查询引擎,在原生推荐配置情况下,在不同场景下做一次横向对比,供大家参考。 每年易观都会发布一次这样的大数据开源测评报告,欢迎...

一个用户增长数据分析师的博客 928

全方位测评HiveSparkSQLPresto 等七个大数据查询引擎,最快的竟是……| 程序员硬核测评 

全方位测评HiveSparkSQLPresto 等七个大数据查询引擎,最快的竟是……| 程序员硬核测评 2019-04-28 17:26 现在大数据组件非常多,众说不一,那么每个企业在不同的使用场景里究竟应该使用哪个引擎呢?易观Spark实战营团队选取了HiveSparkSQLPresto、Impala、HAWQ、ClickHouse、Greenplum七个大数据查询引擎,在原生推荐配置情况下,在不同场景下做一次横向对比,出品了一份开源OLAP引擎测评报告。 现在大数据组件非常多,众说不.

edelweiss2的专栏 2163

Trino(Presto345) on Hive知识总结及TPC-DS测试

文章目录1.PrestoSQL更名Trino2.PrestoSQL-345 与 Hive-3.1.0 的操作2.1 Presto连接Hive配置2.2 基础配置介绍2.2.1 在 Ambari 集群中操作 Hive 组件2.2.2 在 Presto 集群客户端操作2.2.3 Presto支持Hive的分区表操作2.3 优化,提高查询性能2.4 分区操作2.5 特殊列2.6 特殊表2.7 操作示例 Examples2.7.1 create schema(schema相当于MySQL中的数据库名称)2.7.2

TT-Learning 9102

Hive,SQL,MapReduce,Hadoop,Spark等这些关系及理解

由于数据量巨大,单机无法存储,所以我们需要将用很多台机器存储数据,HDFS(Hadoop Distributed FileSystem)就应用而生,它是专门负责管理这么多台单机之间的数据,你存取数据都是单机一样的操作流程,但实际上这些数据都是在多台单机上存储的,相当于HDFS是一个帮你管理大数据的界面,你不用管它后面是怎么的关系,只需要在它这儿操作就可以了。光有数据也不行啊,数据我们是要...

youhuakongzhi的博客 8119

深入浅出Presto:PB级OLAP引擎

现在大数据组件非常多,众说不一,在每个企业不同的使用场景里究竟应该使用哪个引擎呢?这是易观Spark实战营出品的开源Olap引擎测评报告,团队选取了HiveSparksqlPresto、Impala、Hawq、Clickhouse、Greenplum大数据查询引擎,在原生推荐配置情况下,在不同场景下做一次横向对比,供大家参考。 每年易观都会发布一次这样的大数据开源测评报告,欢迎大家给出更好的测评意见以及想要测试的组件。易观Spark实战营是易观大数据技术团队组织的针对大数据初学者的实战训练营,欢.

曾子墨 1094

SparkSQL(一)--(SQL+DataFrame+functions+DataSet)

常见的SQL On Hadoop框架 hive(非常重要):最原始的on hadoop的方案,由facebook贡献;将sql转化为底层MR/Tez/Spark作业;hive的metastore存储了表库的所有信息,而且他几乎是所有 on hadoop的框架通用的,hive2.x.x版本速度上有了很大提升 impala(生产上很少用):可以使用hive的metastore,它推荐的数据...

weixin_30284355的博客 138

开源OLAP引擎哪个快? (Presto、HAWQ、ClickHouse、GreenPlum)

现在大数据组件非常多,众说不一,在每个企业不同的使用场景里究竟应该使用哪个引擎呢?这是易观Spark实战营出品的开源Olap引擎测评报告,团队选取了HiveSparksqlPresto、Impala、Hawq、Clickhouse、Greenplum大数据查询引擎,在原生推荐配置情况下,在不同场景下做一次横向对比,供大家参考。 每年易观都会发布一次这样的大数据开源测评报告,欢迎大家给出更好的测评意见以及想要测试的组件。易观Spark实战营是易观大数据技术团队组织的针对大数据初学者的实战训练营,欢迎搜索.

xuguangyuansh的博客 1151

Presto基础学习--学习笔记

数据库对比presto简介,架构,使用场景,presto日期函数

yfq_29的博客 431

Apache Impala架构解析及与HiveSparkSQL的性能比较_hive引擎执行效率对比(1)

状态管理进程,定时检查The Impala Daemon的健康状况,协调各个运行Impalad的实例之间的信息关系,Impala正是通过这些信息去定位查询请求所要的数据,进程名叫作 statestored,在集群中只需要启动一个这样的进程,如果Impala节点由于物理原因、网络原因、软件原因或者其他原因而下线,Statestore会通知其他节点,避免查询任务分发到不可用的节点上。2.Impala支持内存中数据处理,它访问/分析存储在Hadoop数据节点上的数据,而无需数据移动。

2401_84184638的博客 808

SparkSQL概述

1、SparkSQL前世今生   为什么需要SQL  1)事实上的标准:统计分析的标准  2)易学易用  3)受众面大 例子: 对文本文件进行统计分析: id,name,age,city 1001,zhangsan,45,beijing .... table定义:Person column定义:      id:int      name:string      ag...

BUPT-WT的博客 231
上一篇: JAVA keytool工具使用,生成证书
loophome
博客等级 码龄15年 135粉丝 302原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值