Hadoop集群安装报告

开发者福利!热门AI工具限时免费用 购周边即赠Coding Plan Lite,Claude Code、Cursor等20+工具畅享,效率翻倍! 阅读详情

去年选修了《网络大数据处理理论与实践》课程,本篇博客记录一下当时的安装过程。

安装教程来自:

助教chjtan@pku.edu.cn

http://www.powerxing.com/install-hadoop-cluster/

http://xixici.com/2016/07/18/spark-cookbook/


环境及所需软件说明

1)       Ubuntu 14.04 x64(VMware 12.0虚拟机2台, Master:162.105.85.167  Slave1:162.105.85.184, 一个是master节点,一个是slave节点,必须在同一局域网内)



1)       Hadoop 2.6.0

2)       Java 1.8.0

3)       Spark 1.6.2

4)       Scala 2.10.6

5)       Eclipse 4.4.2

Tips:不要求系统、软件版本等完全一致,但是注意Hadoop、Spark、Scala及其Eclipse插件等有一定搭配要求,最好去官网查查requirements里有没有说明。现在hadoop等都更新很多代了,但是这里建议的几个版本是目前网上教程和QA最多的,出现问题相对来说比较好解决一些。

Hadoop 集群的安装配置大致为如下流程:

  1. 选定一台机器作为 Master
  2. 在 Master 节点上安装 SSH server、安装 Java 环境
  3. 在 Master 节点上安装 Hadoop,并完成配置
  4. 在其他 Slave 节点上安装 SSH server、安装 Java 环境
  5. 将 Master 节点上的 /usr/local/Hadoop-2.6.0 目录复制到其他 Slave 节点上
  6. 在 Master 节点上开启 Hadoop

安装流程

一、       集群配置

配置伪分布式的话,只需要1台机器即可。如果配置集群的话,需要至少两台能连通的机器。如果没有2台实体机的话,可以采取如下方案:

2台虚拟机。更改网络连接方式为桥接(Bridge)模式,宿主机采用有线网卡的话,那么虚拟机可以自动分配IP(和宿主机在同一网段),也可以固定IP。

两台虚拟机的硬件设置——供参考:我的Master内存设置为3G(Spark的Master需要大量内存,内存不足会报错,尽量设2G以上,或者等报错再调也行),Slave内存设置为1.5G。

(1)修改主机名称

       在Master主机上,

       sudo vim /etc/hostname,将localhost改为Master

       sudo vim /etc/hosts,      将127.0.0.1对应的localhost改为Master

       Slave1主机同理


(2)配置hosts文件

在master主机的/etc/hosts文件中新加一行:    192.168.1.107   Slave1

在slave1主机的/etc/hosts文件中新加一行:    192.168.1.109   Master

(3)没有ssh server的安装ssh server(ubuntu 14.04默认没安装)

       安装:sudo apt-get install openssh-server

       输入命令ssh localhost,若提示“The authenticity of host 'localhost (127.0.0.1)' can't beestablished.”(首次登录提示)则说明安装成功。


(4)配置ssh免密登录

这个操作是要让 Master和各个Slave 节点可以无密码互相SSH 登陆到对方节点上。下面以Master为例,Slave同理。

在Master上输入如下命令:

cd ~/.ssh   (若提示不存在,就mkdir ~/.ssh即可)

ssh-keygen -trsa   (然后一直按回车)

cat ./id_rsa.pub>> ./authorized_keys    (让Master能够登录Master本机)

ssh-copy-id -i ~/.ssh/id_rsa.pub chjtan@Slave1   (将公钥传送到Slave1, chjtan是Slave1的用户名)

接着ssh chjtan@Slave1,若能免密直接登录,说明配置成功。

二、       Java环境配置

(1)将jdk-8u60-linux-x64.tar.gz解压到/opt/java/目录下

sudo tar -zxvf your_path/jdk-8u60-linux-x64.tar.gz–C /opt/java


(2)配置环境变量

sudo vim ~/.bashrc, 在末尾另起一行输入如下内容:

export JAVA_HOME=/opt/java/jdk1.8.0_60

export JRE_HOME=/opt/jdk1.8.0_60/jre

export CLASSPATH=.:$CLASSPATH:$JAVA_HOME/lib:$JRE_HOME/lib

export PATH=$PATH:$JAVA_HOME/bin:$JRE_HOME/bin

source ~/.bashrc (使上述配置生效)

java –version,如果显示java version"1.8.0_60"….则说明配置成功


三、       Hadoop集群安装

(1)解压文件

sudo tar -zxvf your_path/hadoop-2.6.0.tar.gz-C /usr/local/


(2)配置环境变量

vim ~/.bashrc

exportPATH=/usr/local/hadoop-2.6.0/bin:$PATH

source ~/.bashrc

输入hadoopversion若正常显示版本,则配置成功

(3)更改hadoop三个文件的java环境

在Master执行如下命令来修改权限(除了下列编辑文件,后面执行命令时也有很多地方需要权限,直接改了):

sudo chown -R chjtan:chjtan/usr/local/hadoop-2.6.0/

cd /usr/local/hadoop-2.6.0/etc/hadoop

修改hadoop-env.sh中的export JAVA_HOME=${JAVA_HOME}如下:

export JAVA_HOME=/opt/java/jdk1.8.0_60

修改yarn-env.sh中的# exportJAVA_HOME=/home/y/libexec/jdk1.6.0/如下:

export JAVA_HOME=/opt/java/jdk1.8.0_60

修改mapred-env.sh中的# exportJAVA_HOME=/home/y/libexec/jdk1.6.0/如下:

export JAVA_HOME=/opt/java/jdk1.8.0_60


(4)hadoop配置修改

cd /usr/local/hadoop-2.6.0/etc/hadoop

vim slaves,删除原来的localhost,并且添加两行,分别是Master和Slave1(根据前面的配置,Master同时作为NameNode和DataNode)

vim core-site.xml, 修改为如下:

<configuration>

       <property>

               <name>fs.defaultFS</name>

               <value>hdfs://Master:9000</value>

       </property>

       <property>

                <name>hadoop.tmp.dir</name>

                <value>file:/usr/local/hadoop-2.6.0/tmp</value>

                <description>Abase forother temporary directories.</description>

       </property>

</configuration>

vim hdfs-site.xml, 修改configuration为如下(其中dfs.replication表示有两个slave节点——根据前面设置Master也作为DataNode):

<configuration>

       <property>

               <name>dfs.namenode.secondary.http-address</name>

               <value>Master:50090</value>

       </property>

       <property>

               <name>dfs.replication</name>

                <value>2</value>

       </property>

       <property>

               <name>dfs.namenode.name.dir</name>

               <value>file:/usr/local/hadoop-2.6.0/tmp/dfs/name</value>

       </property>

       <property>

                <name>dfs.datanode.data.dir</name>

               <value>file:/usr/local/hadoop-2.6.0/tmp/dfs/data</value>

       </property>

</configuration>

cp mapred-site.xml.template mapred-site.xml&& vim mapred-site.xml, 修改为如下:

<configuration>

       <property>

               <name>mapreduce.framework.name</name>

                <value>yarn</value>

       </property>

       <property>

               <name>mapreduce.jobhistory.address</name>

               <value>Master:10020</value>

       </property>

        <property>

               <name>mapreduce.jobhistory.webapp.address</name>

               <value>Master:19888</value>

       </property>

</configuration>

vim yarn-site.xml,修改为如下:

<configuration>

       <property>

                <name>yarn.resourcemanager.hostname</name>

               <value>Master</value>

       </property>

       <property>

               <name>yarn.nodemanager.aux-services</name>

               <value>mapreduce_shuffle</value>

       </property>

</configuration>

配置好后,将 Master 上的 /usr/local/hadoop-2.6.0 文件夹复制到各个节点上。

在Master和各个Slave节点上均执行如下命令来修改权限,以免后面操作遇到权限问题:

sudochown -R chjtan:chjtan /usr/local/hadoop-2.6.0/

四、       测试

首次启动需要在Master节点下完成NameNode的初始化,在Master输入如下命令:

hdfs namenode -format

启动 hadoop ,启动需要在 Master 节点上执行如下几个命令:

cd /usr/local/hadoop-2.6.0/sbin

bash start-dfs.sh (注意,ubuntu 14.04版本中,sh命令默认指向dash,使用dash命令执行会报错,也可以将sh默认指向改为bash,然后用sh命令)

bash start-yarn.sh

bash mr-jobhistory-daemon.sh starthistoryserver


输入jps命令,可以查看各个节点所启动的进程。

正确的话,在 Master 节点上可以看到 NameNode、ResourceManager、SecondrryNameNode、JobHistoryServer 进程,如下图所示:

在 Slave 节点可以看到 DataNode 和 NodeManager 进程,如下图所示:

还可以通过Web 页面看到查看 DataNode 和 NameNode 的状态:http://master:50070/

Tips:

如果碰到什么问题不好解决,想要重头开始做的话,把MasterSlave相关进程全部关了,直接删除MasterSlavehadoop-2.6.0/tmp即可。


五、       配置Eclipse的Hadoop插件

安装Eclipse不多说了,直接下载解压就可以用,我的eclipse目录在/opt/eclipse。

(1)将hadoop-eclipse-plugin-2.6.0.jar复制到eclipse的plugin目录下:

sudo cp your_path/hadoop-eclipse-plugin-2.6.0.jar/opt/eclipse/plugins/

重启Eclipse生效。

如果hadoop版本不是2.6.0的话:这里https://github.com/winghc/hadoop2x-eclipse-plugin/tree/master/release有人已经编译好了几个版本hadoop的插件,如果是其他版本的hadoop,需要自行编译插件,参见http://www.cnblogs.com/myresearch/p/hadoop-eclipse-plugin-jar.html)

(2)配置 hadoop 安装目录

window ->preference -> hadoopMap/Reduce -> Hadoop installation

directory:/usr/local/hadoop-2.6.0/ -> 点击“OK”

(3) 配置Map/Reduce 视图

window ->Open Perspective ->Map/Reduce -> 点击“OK”

window ->Show View -> 搜索“map/reduce Locations”视图 选上 -> 点击“OK”

在eclipse下方就出现了一个“Map/Reduce Locations选项卡”-> 空白地方右键 选“New

Hadoop Location”,按如下方框配置:

(4)在左边project explorer 列表框中找到“DFS Locations”右键refresh,就会看到

一个目录树,eclipse提供了一个目录树来管理HDFS系统,右键可以创建/删除目录,上传/

查看文件,操作起来很简单,内容与命令 hadoop fs -ls 结果一致

(5)新建Map/Reduce程序

File->New->project->Map/ReduceProject->Next

Project name:example ->Next->Finish-> src右键->New->class

Name:example->Finish -> 左侧窗口就显示一个example.java 类文件了


六、       Hadoop做Word Count

关键代码:


建立输入输出文件夹:

hadoop fs -mkdir -p /data/wordcount

hadoop fs -mkdir -p /output/

复制所需文件到data文件夹:

hadoop fs -put ./WordCount /data/wordcount/

查看HDFS的内容:

http://Master:50070/explorer.html#/

执行wordcount 的mapreduce命令:

hadoop jar../share/hadoop/mapreduce/hadoop-mapreduce-examples-2.6.0.jar wordcount /data/wordcount/WordCount_Small/output/wordcount_result


[实验]Hadoop集群安装配置 8、SSH免密登录测试,在hadoop01节点中使用命令 ssh hadoop02,在hadoop02节点中使用命令 ssh hadoop03,在hadoop03节点中使用命令 ssh hadoop01,或直接在hadoop01节点中使用,效果如下。4、和JDK一样,我们安装完成后都需要配置环境变量,使用命令vi /etc/profile进入到该文件后,依旧在最后一行进行配置,参数如下(以下两行参数一定要把地址写对,如果你的地址是自己修改的,需要把第一行中的地址写为你修改的地址)修改完成后保存退出。 阅读详情

相关推荐

大数据开发技术课程报告(搭建Hadoop完全分布式集群&&操作集群

一、 项目简介和实验环境 本项目主要是建立Hadoop完全分布式集群,并进行集群测试和操作。 主要内容:配置hadoop完全分布式集群的前期准备、安装过程、配置文件、启动过程、Shell操作、Java API操作。 (本文中的一些文件可能带有学号后缀,这是课程报告的要求,实际上不必写后缀) Linux发行版:ubuntu-18.04.4-desktop-amd64 JDK版本:jdk1.8.0_144 Hadoop版本:hadoop-2.7.2 二、 虚拟机的各项准备工作 创建三台虚拟机,并完成各项准备

nefu_ljw的博客 1万+

大数据hapdoop安装完整实验报告(包含结果图)

1.掌握Linux虚拟机安装方法或者双操作系统安装方法。Hadoop在Linux操作系统上运行可以发挥最佳性能,鉴于目前可能正在使用Windows操作系统,有必要通过本实验掌握在Windows操作系统上搭建Linux虚拟机的方法。 2.掌握Hadoop的伪分布式安装方法。需要在一台机器上模拟一个小的集群,因此,需要通过本实验掌握在单机上进行Hadoop的伪分布式安装方法。

Windows家庭版下基于Docker的hadoopSpark集群搭建

windows下基于Docker的Spark集群搭建 目录windows下基于Docker的Spark集群搭建1、实验目的2、实验平台3、实验内容和要求3.1 docker环境安装3.1.1 开启Hyper-V3.2 根据已有的docker文件创建镜像3.3 基于docker创建spark集群总结功能快捷键合理的创建标题,有助于目录的生成如何改变文本的样式插入链接图片如何插入一段漂亮的代码片生成一个适合你的列表创建一个表格设定内容居中、居左、居右SmartyPants创建一个自定义列表如何创建一个注脚注释

crhcyq的博客 1364

部署全分布模式Hadoop集群 实验报告

部署全分布模式Hadoop集群 实验报告一、实验目的 1. 熟练掌握 Linux 基本命令。 2. 掌握静态 IP 地址的配置、主机名和域名映射的修改。 3. 掌握 Linux 环境下 Java安装、环境变量的配置、Java 基本命令的使用。 4. 理解为何需要配置 SSH 免密登录,掌握 Linux 环境下 SSH 的安装、免密登录的配置。 5. 熟练掌握在 Linux 环境下如何部署全分布模式 Hadoop 集群。 二、实验环境 本实验所需的软硬件环境包括 PC、VMware Workstation Pro、CentOS 安装包、Oracle JDK 安装包、Hadoop 安装包。 三、实验内容 1. 规划部署。 2. 准备机器。 3. 准备软件环境:配置静态 IP;修改主机名;编辑域名映射;安装和配置 Java安装和 配置 SSH 免密登录。 4. 获取和安装 Hadoop。 5. 配置全分布模式 Hadoop 集群。 6. 关闭防火墙。 7. 格式化文件系统。 8. 启动和验证 Hadoop。 9. 关闭 Hadoop

Hadoop安装实验报告

如果读者正在使用Linux操作系统,则不需要了解Windows系统上的Linux虚拟机安装方法;鉴于目前很多读者正在使用Windows操作系统,因此,为了完成本书的后续实验,这里有必要通过本实验让读者掌握在Windows操作系统上搭建Linux虚拟机的方法。VMware Workstation Player软件的下载地址: https://www.vmware.com/products/workstation-player/workstation-player-evaluation.html。

wujddjdjndn的博客 9653

【虚拟化云计算实验报告Hadoop环境搭建:从系统下载、安装、命令使用,到MapReduce的简单编程实验

一、实验要求 根据课本上的Hadoop的章节的内容,熟悉从系统下载、安装、命令使用,到MapReduce的简单编程实验。 二、实验内容 2.1 部署方式 Hadoop主要有两种安装方式,即传统解压包方式和Linux标准方式。安装Hadoop的同时,还要明确工作环境的构建模式。Hadoop部署环境分为单机模式、伪分布模式和分布式模式三种。 2.2 部署步骤(简述) 步骤1:制定部署规划; 步骤2:部署前工作; 步骤3:部署Hadoop; 步骤4:测试Hadoop。 2.3 准备环境 由于分布式计算需要用到很多

学无止境,勤则可达;志存高远,恒亦能成! 1万+

Hadoop安装实验报告

jdk安装以及Hadoop 安装

weixin_44364897的博客 1万+

Hadoop大数据技术》实验报告(1)Hadoop的伪分布式安装和配置

在linux平台中安装Hadoop,包括JDK安装、SSH免密码配置和伪分布式安装

gxy3202365628的博客 7244

Hadoop分布式集群安装部署实训总结报告

文章目录 前言 一、pandas是什么? 二、使用步骤 1.引入库 2.读入数据 总结 前言 本文为LINUX系统下的Hadoop分布式集群安装部署实训步骤分享 首次分享:望海涵,有错请及时告知。 目标:掌握Hadoop分布时集群安装部署具体步骤相关经验总结 一、Hadoop平台框介绍 除了上面提到的两个核心组件,Hadoop的框架还包括以下两个模块: Hadoop的架构 在其核心,Hadoop主要有两个层次,即: 加工/计算层(Map.

weixin_44803240的博客 2万+

大数据Hadoop安装完整实验报告(包含结果图)

大数据Hadoop安装完整实验报告(包含结果图) 去发现同类优质开源项目:https://gitcode.com/ 实验简介 本实验报告详细记录了大数据处理框架Hadoop在Linux操作系统上的安装过程。实验旨在帮助用户掌握Linux虚拟机的安装方法,以及如何在单台机器上实现Hadoop的伪分布式安装,从而在一台机器上模拟出一个小型的集群环境。 实验目的 学习并掌握Linux虚拟机的安装方法,...

gitblog_06729的博客 305

Hadoop——实验三:Hadoop集群安装部署

文章目录一. 实验目的二. 实验内容三. 实验步骤及结果分析 1. 安装Hadoop集群 1.1 网络配置 1.2 SSH无密码登录配置 1.3 集群分布式环境配置 1.4 配置文件传输至节点 1.5 启动Hadoop集群 2. 完成分布式实例 2.1 在HDFS上创建用户目录 2.2 运行MapReduce作业分布式实例 一. 实验目的   掌握Hadoop集群集群安装部署技术。 二. 实验内容   参考:http://dblab.xmu.edu.cn/blog/install-hadoop-cluste

maochaofei的博客 3196

Hadoop搭建实验报告

NULL 博文链接:https://daxiangwanju.iteye.com/blog/1962175

Hadoop 集群搭建教程

1准备篇 1.1 服务器 10.18.11.130 (master) 机器名:rac1 10.16.11.253( datanode) 机器名:mos5200app 10.18.11.159(datanode) 机器名:rac4 1.2 JDK 版本 Java(TM) SE Runtime Environment (build 1.6.0_35-b10) Java HotSpot...

weixin_30955617的博客 80

Centos7下Hadoop集群中Hbase的安装和配置

Hadoop集群中Hbase的安装和配置(Centos7) 前提:先要安装并配置好jdk和hadoop 一、下载安装Hbase 笔者采用的是本地文件传输到虚拟机的方法,使用的是hbase-1.2.6 链接:https://pan.baidu.com/s/1Kv0WX0wnq-tkdnd8buuBMg 提取码:vxur 使用xftp工具将本地下载好的压缩包传输到虚拟机master的software...

hxhRxz的博客 801

实验三 Hadoop HA 集群安装

实验目的 1、linux 基础知识和操作命令,如 vi、mkdir、cp、mv、tar、wget、scp 等等 2、下载安装和环境变量配置 3、zookeeper 基础原理和功能 4、Hadoop 基础知识,如:HDFS、YARN、NameNode、DataNode、active、Standby 机制等等 5、掌握 Hadoop HA 的配置方法 6、掌握 Hadoop HA 启动和测试方法 实验环境 1、64 位电脑,8G 以上内存 2、win10 系统 3、本实验是在实验一、实验二的基础上操作的,有关软

weixin_43482612的博客 414

Hadoop集群搭建(六:HBase的安装配置)

实验 目的 要求 目的: 1、HBase的高可用完全分布模式的安装和验证 要求: 完成HBase的高可用完全分布模式的安装; HBase的相关服务进程能够正常的启动; HBase控制台能够正常使用; 表创建、数据查询等数据库操作能够正常进行; ...

Eyeshot的博客 2481

hadoop hbase hive 集群安装

一:卸载redhat操作系统默认jdk 1:查找安装默认安装jdk    rpm -qa | grep java 2:删除jdk    rpm -e --nodeps java-1.6.0-openjdk-1.6.0.0-1.21.b17.el6.x86_64 二:安装oracle jdk 1:使用root账号安装 2:创建目录:/usr/java 3:下载jd

ly4983的专栏 1284

搭建hadoop集群,从安装虚拟机开始直到hadoop成功搭建

搭建Hadoop集群一、实验目的要求学习和掌握Hadoop的相关应用,首先必须得学会搭建Hadoop集群。本次实验将针对Hadoop集群的搭建内容进行演练。学会虚拟机的安装和克隆,Linux系统的网络配置和SSH配置,Hadoop集群的搭建和配置,Hadoop集群测试,熟悉Hadoop集群基本的操作。要求:1、认真理解集群搭建过程,通过实践成功搭建Hadoop集群。2、结合实践内容和教材的相关章节完成实验报告。二、实验内容1、虚拟机安装2、虚拟机克隆3、Linux系统网络配置4、SSH服务配置5、JDK安

sgsgsgwe的博客 3862
上一篇: 远程打印调试信息工具LogPrintf
下一篇: VLC编译记录 Ubuntu16.04
Hchnr
博客等级 码龄12年 4粉丝 2原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值