spark 1.0 编译支持 hadoop 2.4.0

Spark 1.0.0 横空出世 Spark on Yarn 部署(Hadoop 2.4) 就在昨天,北京时间5月3020点多。Spark 1.0.0终于发布了:Spark 1.0.0 released 根据官网描述,Spark 1.0.0支持SQL编写:Spark SQL Programming Guide 个人觉得这个功能对Hive的市场的影响很小,但对Shark冲击很大,就像win7和winXP的关系,自相残杀嘛? 这么着急的发布1.x 版是商业行为还是货真价实的体现,让我们拭目以待吧~~~~ 本文是CSDN-撸大湿原创,如要转载请注明出处,谢谢:http://blog.csdn.net 阅读详情

 

 

 

 

北京时间5月30日20点多。Spark1.0.0发布。详见  http://spark.apache.org/releases/spark-release-1-0-0.html

在官方发布的版本中,默认支持的是hadoop 2.2,不是最新的hadoop 2.4.0

作为尝鲜一族,现在尝试将spark 进行编译,支持hadoop 2.4.0。

 

1、源码编译环境

 

软件

版本

地址

Centos

6.4 X64

http://mirrors.163.com/centos/6.4/isos/x86_64/CentOS-6.4-x86_64-bin-DVD1.iso

maven  

3.2.1

 http://mirrors.hust.edu.cn/apache/maven/maven-3/3.2.1/binaries/apache-maven-3.2.1-bin.tar.gz

java

1.7

http://www.oracle.com/technetwork/java/javase/downloads/index.html

Hadoop

2.4.0

http://mirror.bit.edu.cn/apache/hadoop/common/hadoop-2.4.0/

Spark

1.0.0

http://mirrors.cnnic.cn/apache/spark/spark-1.0.0/spark-1.0.0.tgz

 

2、环境设置

 /etc/profile

 

#set java environment

JAVA_HOME=/opt/jdk1.7.0_55

PATH=$JAVA_HOME/bin:$PATH

CLASSPATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar

export JAVA_HOME CLASSPATH PATH

 

#set hadoop

export HADOOP_HOME=/opt/hadoop-2.4.0

export PATH=$PATH:$HADOOP_HOME/bin

  

#set MAVEN

export MAVEN_HOME=/opt/apache-maven-3.2.1

export PATH=${PATH}:${MAVEN_HOME}/bin

export MAVEN_CMD=$MAVEN_HOME/bin/mvn

 

#set SCALA

export SCALA_HOME=/opt/scala-2.10.4

export PATH=$PATH:$SCALA_HOME/bin

3、编译

解压源码,在根去根目录下执行以下命令

./make-distribution.sh --hadoop 2.4.0--with-yarn --tgz --with-hive

几个重要参数

--hadoop :指定Hadoop版本

--with-yarn yarn支持是必须的

--with-hive 读取hive数据也是必须的,反正我很讨厌Shark,以后开发们可以在Spark上自己封装SQL&HQL客户端,也是个不错的选择。

#     --tgz: Additionally creates spark-$VERSION-bin.tar.gz

#     --hadoop VERSION: Builds againstspecified version of Hadoop.

#     --with-yarn: Enables support forHadoop YARN.

#     --with-hive: Enable support forreading Hive tables.

#     --name: A moniker for the releasetarget. Defaults to the Hadoopverison.

 

 

 

经过漫长的等待,在源码跟目录下会生成一个tgz压缩包    

 编译成功

[WARNING] See http://docs.codehaus.org/display/MAVENUSER/Shade+Plugin
[INFO] ------------------------------------------------------------------------
[INFO] Reactor Summary:
[INFO] 
[INFO] Spark Project Parent POM .......................... SUCCESS [  1.505 s]
[INFO] Spark Project Core ................................ SUCCESS [01:52 min]
[INFO] Spark Project Bagel ............................... SUCCESS [ 13.727 s]
[INFO] Spark Project GraphX .............................. SUCCESS [03:42 min]
[INFO] Spark Project ML Library .......................... SUCCESS [06:31 min]
[INFO] Spark Project Streaming ........................... SUCCESS [ 47.049 s]
[INFO] Spark Project Tools ............................... SUCCESS [  7.437 s]
[INFO] Spark Project Catalyst ............................ SUCCESS [ 35.608 s]
[INFO] Spark Project SQL ................................. SUCCESS [01:08 min]
[INFO] Spark Project Hive ................................ SUCCESS [04:23 min]
[INFO] Spark Project REPL ................................ SUCCESS [ 31.167 s]
[INFO] Spark Project YARN Parent POM ..................... SUCCESS [ 34.463 s]
[INFO] Spark Project YARN Stable API ..................... SUCCESS [ 18.475 s]
[INFO] Spark Project Assembly ............................ SUCCESS [01:06 min]
[INFO] Spark Project External Twitter .................... SUCCESS [ 14.859 s]
[INFO] Spark Project External Kafka ...................... SUCCESS [01:28 min]
[INFO] Spark Project External Flume ...................... SUCCESS [ 19.153 s]
[INFO] Spark Project External ZeroMQ ..................... SUCCESS [ 24.138 s]
[INFO] Spark Project External MQTT ....................... SUCCESS [ 22.316 s]
[INFO] Spark Project Examples ............................ SUCCESS [03:14 min]
[INFO] ------------------------------------------------------------------------
[INFO] BUILD SUCCESS
[INFO] ------------------------------------------------------------------------
[INFO] Total time: 27:58 min
[INFO] Finished at: 2014-06-08T13:07:47+08:00
[INFO] Final Memory: 100M/914M
[INFO] ------------------------------------------------------------------------
You have new mail in /var/spool/mail/root



查看一下 


[root@NameNode spark-1.0.0]# ll
total 183784
drwxrwxr-x 4 1000 1000      4096 Jun  8 13:00 assembly
drwxrwxr-x 4 1000 1000      4096 Jun  8 12:41 bagel
drwxrwxr-x 2 1000 1000      4096 May 26 14:47 bin
-rw-rw-r-- 1 1000 1000    281471 May 26 14:47 CHANGES.txt
drwxrwxr-x 2 1000 1000      4096 May 26 14:47 conf
drwxrwxr-x 4 1000 1000      4096 Jun  8 12:39 core
drwxrwxr-x 3 1000 1000      4096 May 26 14:47 data
drwxrwxr-x 4 1000 1000      4096 May 26 14:47 dev
drwxr-xr-x 9 root root      4096 Jun  8 13:07 dist
drwxrwxr-x 3 1000 1000      4096 May 26 14:47 docker
drwxrwxr-x 7 1000 1000      4096 May 26 14:47 docs
drwxrwxr-x 4 1000 1000      4096 May 26 14:47 ec2
drwxrwxr-x 4 1000 1000      4096 Jun  8 13:07 examples
drwxrwxr-x 7 1000 1000      4096 May 26 14:47 external
drwxrwxr-x 4 1000 1000      4096 May 26 14:47 extras
drwxrwxr-x 5 1000 1000      4096 Jun  8 12:45 graphx
drwxr-xr-x 3 root root      4096 Jun  8 12:59 lib_managed
-rw-rw-r-- 1 1000 1000     29983 May 26 14:47 LICENSE
-rwxrwxr-x 1 1000 1000      8126 May 26 14:47 make-distribution.sh
drwxrwxr-x 5 1000 1000      4096 Jun  8 12:51 mllib
-rw-rw-r-- 1 1000 1000     22559 May 26 14:47 NOTICE
-rw-rw-r-- 1 1000 1000     35121 May 26 14:47 pom.xml
drwxrwxr-x 4 1000 1000      4096 May 26 14:47 project
drwxrwxr-x 6 1000 1000      4096 Jun  8 12:08 python
-rw-rw-r-- 1 1000 1000      4221 May 26 14:47 README.md
drwxrwxr-x 4 1000 1000      4096 Jun  8 12:59 repl
drwxrwxr-x 2 1000 1000      4096 May 26 14:47 sbin
drwxrwxr-x 2 1000 1000      4096 May 26 14:47 sbt
-rw-rw-r-- 1 1000 1000      7703 May 26 14:47 scalastyle-config.xml
-rw-r--r-- 1 root root 187677812 Jun  8 13:07 spark-1.0.0-bin-2.4.0.tgz
drwxrwxr-x 5 1000 1000      4096 May 26 14:47 sql
drwxrwxr-x 4 1000 1000      4096 Jun  8 12:52 streaming
drwxr-xr-x 5 root root      4096 Jun  8 12:39 target
drwxrwxr-x 4 1000 1000      4096 Jun  8 12:52 tools
-rw-rw-r-- 1 1000 1000       805 May 26 14:47 tox.ini
drwxrwxr-x 6 1000 1000      4096 Jun  8 13:00 yarn
You have new mail in /var/spool/mail/root
[root@NameNode spark-1.0.0]# vi /etc/profile

把这个包 spark-1.0.0-bin-2.4.0.tgz 复制到你想部署的目录并解压。

特别注意:只需要把解压包copy到yarn集群中的任意一台。一个节点就够了,不需要在所有节点都部署,除非你需要多个Client节点调用spark作业。


在这里直接给出已编译好的 版本,方便使用。

http://pan.baidu.com/s/1dD9udET 


spark-2.4.0 源码编译 环境:   hadoop2.6.0-cdh5.7.0   jdk 8 +   maven 3.5.4 +   scala 2.11 这里提醒下,spark2.4.0之前的版本maven使用 3.3.9+ 就可以了; spark2.2.0之前的版本支持jdk 7。 源码下载安装 [hadoop@hdp001 softwore]$ wget https://archi... 阅读详情

相关推荐

Spark 2.4.0 集成Hive 1.2.1

Spark 2.4.0 集成Hive 1.2.1 更多资源 github: https://github.com/opensourceteams/spark-scala-maven-2.4.0 apache-hive-1.2.1-bin 安装: https://github.com/opensourceteams/apache-hive-1.2.1-bin 官网文档 https://spar...

大数据技术分享 2909

spark源码编译

jdk 1.7以上哦。直接使用eclipse就可以导入了,ant编译之后,就直接可以运行。 具体情况我博客 http://blog.csdn.net/dao2012/article/details/52585152

基于Spark 2.0.0搭建Hive on Spark环境

如何让HIVE 2.2.0使用Spark 2.0.0计算框架。

纠了个结De聖的博客 9957

Spark编译

http://chengyanbin.blog.51cto.com/3900113/1597359 转载于:https://blog.51cto.com/leochencipher/1598027

weixin_34198583的博客 113

Spark源码阅读_1Spark2.4.3 win10 IDEA 源码编译调试踩坑

1.安装包准备 jdk1.8 maven3.5.4 scala2.11.2 git2.32.0 spark2.4.3【spark-2.4.3.tgz 】 注意:安装过程,自行百度,版本要一致,我是认真看了pom文件确定的版本。 2.报错 在源码根目录运行cmd,执行 ./build/mvn -Pyarn -Phadoop-2.6 -Dhadoop.version=2.6.5 -DskipTests clean package 报错如下: [INFO] BUILD FAILURE [INFO] ---..

海若_matrix的博客 259

Spark源码分析系列—编译源码

1 Spark源码的下载 作为一名大数据开发工程师,研读源码是我们日常开发学习中必不可少的环节,而万里长征的第一步就是编译源码。开源Spark主要有3大发行版Apache,CDH和HDP,本文以Apache Spark 2.4.5为例展开。 1) 访问Apache Spark官网http://spark.apache.org/,点击Download 2)选择版本和文件类型 特别注意最后一行声明...

JayLaiSCUT的博客 6087

spark2.4.3源码编译支持hadoop-2.6.0-cdh5.15.1和scala 2.12.8

环境准备 1.下载下面需要的软件 maven apache-maven-3.5.4-bin.tar.gz scala scala-2.12.8.tgz java jdk-8u45-linux-x64.gz spark编译spark-2.4.3.tgz 2.hadoop用户下创建目录,并上传这些软件 [hadoop@hadoop001 ~]$ mkdir app s...

whiteblacksheep的博客 656

基于CentOS6.4环境编译Spark-2.1.0源码

基于CentOS6.4环境编译Spark-2.1.0源码   1 写在前面的话 有些小伙伴可能会问:Spark官网不是已经提供了Spark针对不同版本的安装包了吗,我们为什么还需要对Spark源码进行编译呢?针对这个问题我们到Spark官网: spark.apache.org来看下,如下图所示: Spark官网的确是提供了一些Hadoop版本的Spark安装包,但是提供的这些是否能够满...

小米吃辣椒的博客 1178

Apache Spark 编译、打包过程

目录1 下载源码 版本: Ubuntu 20.04.2 LTS Apache Maven 3.6.3 JDK 1.8 R 3.1.1 1 下载源码 # 下载源码,推荐这样下载 git clone https://github.com/apache/spark.git # 查看所有的tag,每个tag都是一个版本 git tag # 切换到指定版本,这里我要编译的版本是2.4.0 git checkout v2.4.0 ...

终回首的博客 1232

spark学习十二 hive on spark 环境搭建及测试

安装概览 整体的安装过程分为以下几步 搭建Hadoop集群 (整个cluster由3台机器组成,一台作为Master,另两台作为Slave)编译Spark 1.0,使其支持Hadoop 2.4.0和Hive运行Hive on Spark的测试用例 (SparkHadoop Namenode运行在同一台机器) Hadoop集群搭建 创建虚拟机 创建基于kvm的虚拟机,

西红柿炒土豆 1151

hive 1.2.1源码编译

Hive 1.2.1源码编译依赖的Hadoop版本必须最少是2.6.0,因为里面用到了Hadoop的org.apache.hadoop.crypto.key.KeyProvider和org.apache.hadoop.crypto.key.KeyProviderFactory两个类,而这两个类在Hadoop 2.6.0才出现,否者会出现以下编译错误: [ERROR] /home/q/spar

xiao_jun_0820的专栏 1821

Apache Spark源码走读之12 -- Hive on Spark运行环境搭建

欢迎转载,转载请注明出处,徽沪一郎。 楔子 Hive是基于Hadoop的开源数据仓库工具,提供了类似于SQL的HiveQL语言,使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于Hdfs中的海量数据进行分析。由于这一特性而收到广泛的欢迎。 Hive的整体框架中有一个重要的模块是执行模块,这一部分是用Hadoop中MapReduce计算框架来实现,因而在处理速度上不是非常...

weixin_34352005的博客 69

对于Spark1.3进行编译

编译其实是按照官方文档进行的,比较简单,文档地址是:http://spark.apache.org/docs/latest/building-spark.html 编译命令最终是: 先要执行: export MAVEN_OPTS="-Xmx2g -XX:MaxPermSize=512M -XX:ReservedCodeCacheSize=512m" 然后再执行: build...

weixin_34384557的博客 115

spark on yarn 安装笔记

yarn版本:hadoop2.7.0 spark版本:spark1.4.0 0.前期环境准备:   jdk 1.8.0_45   hadoop2.7.0   Apache Maven 3.3.3 1.编译spark on yarn   下载地址:http://mirrors.cnnic.cn/apache/spark/spark-1.4.1/spark-1.4.1.tgz ...

abc9169的博客 157

Hive on Spark运行环境搭建

Hive是基于Hadoop的开源数据仓库工具,提供了类似于SQL的HiveQL语言,使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于Hdfs中的海量数据进行分析。由于这一特性而收到广泛的欢迎。 Hive的整体框架中有一个重要的模块是执行模块,这一部分是用Hadoop中MapReduce计算框架来实现,因而在处理速度上不是非常令人满意。由于Spark出色的处理速度,有人已

DF_XIAO的专栏 1627

编译Spark2.+ 、Hadoop CDH 版本

参考官方文档:http://spark.apache.org/docs/latest/building-spark.html Spark2.2+移除了对hadoop2.5的支持!!! 一、 Spark-2.1.2 编译环境准备 1hadoop-2.5.0-cdh5.3.6 2、安装并配置好Maven(本次编译使用apache maven 3.3.9) 3、 安装并配置JDK(本次编译使...

行走的树 1804
上一篇: yum 故障 File "/usr/lib64/python2.6/threading.py", line 474, in start
下一篇: There is insufficient memory for the Java Runtime Environment to continue. 解决
liema2000
博客等级 码龄20年 54粉丝 22原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值