【Spark亚太研究院系列丛书】Spark实战高手之路-第一章 构建Spark集群(第四步)(1)

限时加码!20+主流AI编程工具免费用 购周边加赠Coding Plan Lite,Claude Code、Cursor等即刻畅享,学习进阶更高效! 阅读详情

第一步:通过Spark的shell测试Spark的工作

 

Step1:启动Spark集群,这一点在第三讲讲的极为细致,启动后的WebUI如下:

Step2:启动Spark Shell:


此时可以通过如下Web控制台查看shell的情况:


Step3:把Spark安装目录“README.md”拷贝到HDFS系统上

在Master节点上新启动一个命令终端,并进入到Spark安装目录下:


我们把文件拷贝到HDFS的root文件夹下:


可以看出sc就是SparkContext的实例,这是在启动Spark Shell的时候系统帮助我们自动生成的,SparkContext是把代码提交到集群或者本地的通道,我们编写Spark代码,无论是要运行本地还是集群都必须有SparkContext的实例。

接下来,我们读取“README.md”这个文件:


我们把读取的内容保存给了file这个变量,其实file是一个MappedRDD,在Spark的代码编写中,一切都是基于RDD操作的;

 

再接下来,我们从读取的文件中过滤出所有的“Spark”这个词


此时生成了一个FilteredRDD;

再接下来,我们统计一下“Spark”一共出现了多少次:

从执行结果中我们发现“Spark”这个词一共出现了15次。

此时,我们查看Spark Shell的Web控制台:

发现控制台中显示我们提交了一个任务并成功完成,点击任务可以看到其执行详情:

那我们如何验证Spark Shell对README.md这个文件中的“Spark”出现的15次是正确的呢?其实方法很简单,我们可以使用Ubuntu自带的wc命令来统计,如下所示:

发现此时的执行结果也是15次,和Spark Shell的计数是一样一样的。

Spark-shell批量命令执行脚本的方法 今天小编就为大家分享一篇Spark-shell批量命令执行脚本的方法,具有很好的参考价值,希望对大家有所帮助。一起跟随小编过来看看吧 立即下载

相关推荐

应急响应之windows日志分析工具logparser使用

windows日志分析工具logparser使用介绍

u013930899的博客 8091

Spark-shell运行测试

调度每个job执行,在启动Spark-shell时,自动创建Spark context对象,变量名称为:sc,提供给用户读取数据。在spark-shell界面加载数据:val wordRDD = sc.textFile("/datas/wordscount.txt");分割数据: val wordsRDD=wordRDD.flatMap(line => line.split("\\s+"))在启动spark-shell时,自动创建SparkSession对象,变量名称为:spark,以供用户使用读取数据。

2202_75347029的博客 680

数学不好是原罪——高等数学笔记(汇总版)

这是本人之前考研的高数手写笔记,工科学硕数一考了146(满分150),笔记有一定参考价值,欢迎大家收藏借鉴。

xuuyann 5万+

详细介绍Spark安装[内含测试小案例]

SparkSpark运行模式Spark环境搭建上传 & 解压解压目录说明启动spark-shell初体验-读取HDFS文件Standalone集群模式集群角色介绍集群规划修改配置并分发通过scp 命令将配置文件分发到其他机器上集群启动和停止测试Standalone-HA高可用模式原理配置HAScp到其他节点启动zk集群启动Spark集群测试HAOn Yarn集群模式准备工作cluster模式Client模式[了解]两种模式的区别Spark参数详解spark-shellspark-submit参数总结

2658

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群第四步)(1)...

2019独角兽企业重金招聘Python工程师标准>>> ...

weixin_34112208的博客 156

spark2.0.2测试spark-shell

spark2.0.2测试spark-shell 上一篇文章介绍的是如何进行spark环境的搭建以及启动和关闭spark。本篇文章讲述的是如何在spark上利用spark-shell进行简单的测试。 下面上货: 首先看截图: 1、首先进入到命令行模式: /home/spark/bin/spark-shell 然后就能看见spark的图标了。 2、

archer的技术故事 3060

Spark教程——(3)编写spark-shell测试Demo

创建一个文件aa.txt,随便写点内容: hello world! aa aa d d dg g 登录HDFS文件系统: [root@node1 ~]# su hdfs 在HDFS文件系统中创建文件目录保存要上传的数据: bash-4.2$ hdfs dfs -mkdir -p /user/cf 然后将CentOS文件系统上的aa.txt文件上传到H...

weixin_30544657的博客 628

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第三步)(3)

启动并查看集群的状况 第一步:启动Hadoop集群,这个在第二讲中讲解的非常细致,在此不再赘述: 启动之后在Master这台机器上使用jps命令,可以看到如下进程信息: 在Slave1 和Slave2上使用jps会看到如下进程信息: 第二步:启动Spark集群  在Hadoop集群成功启动的基础上,启动Spark集群需要使用Spark的sbin

wwttz1974的专栏 1244

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第五步)(13)

从控制台可以看到我们的程序成功在集群上运行:   Detail for stage 1

wwttz1974的专栏 581

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第五步)(1

第一步:构造分布式Hadoop2.2.0集群 1,在Windows 7(本教程中的Spark集群运行的机器是8G的Windows内存)上安装VMware虚拟机(我们安装的是VMware-workstation-full-9.0.2),本教程中的VMware Workstation下载地址:        https://my.vmware.com/cn/web/vmware/det

wwttz1974的专栏 1739

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第二步)(1

在VMWare 中准备第二、第三台运行Ubuntu系统的机器;   在VMWare中构建第二、三台运行Ubuntu的机器和构建第一台机器完全一样,再次不在赘述。。 与安装第一台Ubuntu机器不同的几点是: 第一点:我们把第二、三台Ubuntu机器命名为了Slave1、Slave2,如下图所示: 创建完的VMware中就有三台虚拟机了: 第二

wwttz1974的专栏 894

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第三步)(1

第一步:Spark集群需要的软件;  在1、2讲的从零起步构建好的Hadoop集群的基础上构建Spark集群,我们这里采用2014年5月30日发布的Spark 1.0.0版本,也就是Spark的最新版本,要想基于Spark 1.0.0构建Spark集群,需要的软件如下:   1.Spark 1.0.0,笔者这里使用的是spark-1.0.0-bin-hadoop1.tgz,

wwttz1974的专栏 1128

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第三步)(2)

安装Spark   Master、Slave1、Slave2这三台机器上均需要安装Spark。 首先在Master上安装Spark,具体步骤如下: 第一步:把Master上的Spark解压:

wwttz1974的专栏 1299

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第二步)(3)

首先修改Master的core-site.xml文件,此时的文件内容是: 我们把“localhost”域名修改为“Master”:

wwttz1974的专栏 964

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第五步)(9)

第二步:构造分布式的Spark1.0.2集群   1,下载Scala 2.10.4,具体下载地址: http://www.scala-lang.org/download/2.10.4.html  在Ubuntu机器上Scala会帮助我们自动选择“scala-2.10.4.tgz”进行下载;   2,安装和配置Scala 我们需要在SparkMaster、SparkWorker1以及S

wwttz1974的专栏 586

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群第四步)(7)

第四步:通过Spark的IDE搭建并测试Spark开发环境   Step 1:导入Spark-hadoop对应的包,次选择“File”–> “Project Structure” –> “Libraries”,选择“+”,将spark-hadoop 对应的包导入: 点击“OK”确认: 点击“OK”:

wwttz1974的专栏 580

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群第四步)(2)

第二步:使用Spark的cache机制观察一下效率的提升   基于上面的内容,我们在执行一下以下语句:

wwttz1974的专栏 805

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第五步)(10)

SparkWorker1 和SparkWorker2上使用jps会看到如下进程信息: 第二步:启动Spark集群 在Hadoop集群成功启动的基础上,启动Spark集群需要使用Spark的sbin目录下“start-all.sh”:

wwttz1974的专栏 501

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第三步)(1)...

2019独角兽企业重金招聘Python工程师标准>>> ...

weixin_34194087的博客 163

Spark亚太研究院系列丛书Spark实战高手之路-第一章 -构建Spark集群1

对于90%以上想学习Spark的人而言,如何构建Spark集群是其最大的难点之一,为了解决大家构建Spark集群的一切困难,家林把Spark集群构建分为了四个步骤,从零起步,不需要任何前置知识,涵盖操作的每一个细节,构建完整的Spark集群。从零起步,构建Spark集群经典四部曲: 第一步:搭建Hadoop单机和伪分布式环境; 第二步:构造分...

weixin_33937499的博客 132

Spark亚太研究院系列丛书Spark实战高手之路-第一章 构建Spark集群(第二步)(2)

进入第二台机器,看一下这台主机的IP地址: 可以看出这台主机的IP地址是“192.168.184.131”. 我们在/etc/hostname中把主机名称修改为“Slave1”:

wwttz1974的专栏 890
上一篇: 【Spark亚太研究院系列丛书】Spark实战高手之路-第一章 构建Spark集群(第三步)(3)
下一篇: 【互动问答分享】第11期决胜云计算大数据时代Spark亚太研究院公益大讲堂
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值