python虚拟环境可以运行pyspark_0483-如何指定PySpark的Python运行环境

温馨提示:如果使用电脑查看图片不清晰,可以使用手机打开文章单击文中的图片放大查看高清原图。

Fayson的github:

https://github.com/fayson/cdhproject

提示:代码块部分可以左右滑动查看噢

1

文档编写目的

在使用PySpark进行开发时,由于不同的用户使用的Python环境不同,有基于Python2的开发也有基于Python3的开发,这个时候会开发的PySpark作业不能同时兼容Python2和Python3环境从而导致作业运行失败。那Fayson接下来介绍如何在提交PySpark作业时如何指定Python的环境。

本文档就主要以Spark2的为例说明,Spark1原理相同。

测试环境

1.RedHat7.2

2.CM和CDH版本为5.15.0

3.Python2.7.5和Python3.6

2

准备PySpark示例作业

这里以一个简单的PI PySpark代码来做为示例讲解,示例代码如下:

3

准备Python环境

在这里Fayson准备两个环境Python2和Python3,如下为环境准备步骤:

1.在Anaconda官网下载Python2和Python3的两个安装包,安装过程Fayson这里就不再介绍了

Anaconda3-5.2.0-Linux-x86_64.sh和Anaconda2-5.3.1-Linux-x86_64.sh两个安装包

2.将Python2和Pythonn3两个环境打包,进入到Python2和Python3的安装目录下

使用zip命令将两个环境分别打包

注意:这里是进入到Python的安装目录下进行压缩的,没有带上Python的父目录

3.将准备好的Python2和Python3上传至HDFS

完成以上步骤则准备好了PySpark的运行环境,接下来在提交代码时指定运行环境。

4

指定PySpark运行环境

1.将当前的Spark2 Gateway节点下/etc/spark2/conf/spark-default.conf配置文件拷贝一份

2.在拷贝的spark-default.conf文件中增加如下配置

3.使用spark2-submit命令提交pi.py作业测试运行的Python环境

作业提交成功

作业执行成功

4.查看作业运行的Python环境

5.将执行环境修改为Python3测试

作业提交成功

作业运行成功

查看作业的运行环境

5

总结

在将PySpark的运行环境Python2和Python3打包放在HDFS后,作业启动的过程会比以往慢一些,需要从HDFS获取Python环境。

提示:代码块部分可以左右滑动查看噢

为天地立心,为生民立命,为往圣继绝学,为万世开太平。

温馨提示:如果使用电脑查看图片不清晰,可以使用手机打开文章单击文中的图片放大查看高清原图。

Microduck模型以及仿真框架 Microduck模型以及仿真框架,带Microduck整套stl模型 立即下载

相关推荐

Computer-Agent-Affordance-Recovery-Path-Rehearsal-Planner-v1.0-原创源码与文档.zip

原创 Node.js 命令行工具源码与完整文档,包含 README、MIT License、自动化测试、真实运行截图和原创授权声明。适合开发者学习工程化实现、复现测试流程与二次开发;解压后按 README 运行 npm test 和 node src/index.js。不含第三方受限素材、模型权重或品牌资源。

python虚拟环境可以运行pyspark_Python学习—PySpark环境搭建

PySparkPython整合Spark的一个扩展包,可以使用Python进行Spark开发。而PySpark需要依赖Spark环境,Spark需要依赖Hadoop环境,而且,本地环境需要安装JDK和Scala。一、环境准备Scala环境搭建,本例环境为2.11.8JDK环境搭建,本例环境为jdk1.8Python环境准备,本例环境为Anaconda,版本为python 3.7说明本例中假设上述...

weixin_39860919的博客 545

Coding-Backlog-Queue-Cross-Run-Consistency-Scorecard-v1.0-原创源码与文档.zip

原创 Node.js 命令行工具源码与完整文档,包含 README、MIT License、自动化测试、真实运行截图和原创授权声明。适合开发者学习工程化实现、复现测试流程与二次开发;解压后按 README 运行 npm test 和 node src/index.js。不含第三方受限素材、模型权重或品牌资源。

pyspark 中使用集群未安装python三方库:加载虚拟python环境

pyspark 中使用集群未安装python三方库:加载虚拟python环境 在使用pyspark运行python代码的过程中,通常遇到集群环境中没有相应的python三方库,即:ImportError: No module named ** ,对于该种情况,通常有两种解决方案: 1. 集群中的python环境安装相应的三方库! 走流程、找运维,贼麻烦 2. 集群未配置python环境,加载虚拟python环境!(重点讲解该方式,用起来贼方便) 未加载库的通常处理方式 使用pyspark过程中

tinstone的博客 3427

python虚拟环境可以运行pyspark_pyspark使用自定义的python

出于种种原因,spark集群节点中的环境会不一致,会出现一些莫名其妙的错误,在没有root权限的情况下,可以使用自己配置好的python包分发到集群节点上使用;比方说,本机是python2.7,节点是python2.6的错误:Exception: Python in worker has different version 2.6 than that in driver 2.7, PySpark ...

weixin_39782573的博客 546

python虚拟环境可以运行pyspark_0485-如何在代码中指定PySparkPython运行环境

1文档编写目的Fayson在前面的文章《0483-如何指定PySparkPython运行环境》介绍了使用Spark2-submit提交时指定Python运行环境。也有部分用户需要在PySpark代码中指定Python运行环境,那本篇文章Fayson主要介绍如何在代码中指定PySparkPython运行环境。测试环境1.RedHat7.22.CM和CDH版本为5.15.03.Python2....

weixin_39621060的博客 161

win系统下pycharm下py2.x和py3.x双环境的pyspark配置

一、py2.x和py3.x双环境的安装 第一步:首先在win上分别安装anaconda2和anaconda3,注意安装在不同的文件路径下,并且在安装二个的时候下边这二个框不一定不勾选,安装第一个时候可以勾选。 然后,分别设置好环境变量,如果第一个勾选了上边二个框是会自动设置环境变量的 安装好后,分别找到安装目录,修改python.exe的名字分别修改为python2.exe,pyth...

qq_39954916的博客 478

PySpark yarn优化以及使用(依赖解决、python虚拟环境使用)————附带解释和代码

文章目录1 spark yarn的常见模式以及区分1.1 模式1.2 使用2 yarn模式下的自编写包依赖解决2.1 准备知识2.2 使用3 yarn模式下的jar包依赖解决3.1 spark运行时需要的包3.2 非spark运行时必要的包附录 1 spark yarn的常见模式以及区分 1.1 模式 1,client 提交方式: –master yarn –deploy-mode client 特点: 1,driver运行在提交作业的机器上(可以看到程序打印日志); 2,cluster

韩江雪de 小屋 3961

pyspark在分布式环境中引入虚拟环境

背景: 当我们的代码逻辑依赖于一个虚拟环境,怎么将这个环境在一个分布式集群中使用呢? 1 我们有一个django项目,里面有venv的虚拟环境 我们需要打包这个环境: zip -r ai-alg.zip ai-alg 2 程序执行命令 主要看椭圆的部分 参数说明: –conf spark.pyspark.python=./local_venv/local_venv/bin/python #executor集群端的pyspark配置,即任务执行的机器 –conf spark.pyspark.driver.

weixin_42237388的博客 481

pyspark基于python虚拟环境运行

1.背景 目前大数据使用的是Amazon EMR集群,该集群可根据计算需求变化灵活扩展或收缩集群,就会存在一个问题:当spark任务提交之后,EMR集群会根据计算的需求进行扩展,新扩展的机器上python环境各不相同,并且每次扩展的机器ip不相同(不是同一台机器),对某些第三方包,例如:pandas 还会依赖numpy,并且对版本还有一定要求,必须大于15.4;此时python依赖的冲突就会导致spark任务执行失败。 2.解决方案 鉴于以上问题,通过搭建独立的Python运行环境可以解决以上问题,同时还可

jin_tmac's studio 1608

IDEA_安装模块库/pySpark安装指定版本/管理/修改虚拟环境/添加/管理python pip安装源/为虚拟环境更新pip/导入虚拟环境

操作步骤 project structure opening(optional)

xuchaoxin1375的博客 838

spark如何配置Python虚拟环境

方式一 # 在代码中配置环境变量 import os os.environ["SPARK_HOME"] = "/usr/local/Cellar/apache-spark/1.5.1/" os.environ["PYSPARK_PYTHON"]="/usr/local/bin/python3" 方式二

jia_7m的博客 1269

Pyspark spark-submit 集群提交任务以及引入虚拟环境依赖包攻略

  网上提交 scala spark 任务的攻略非常多,官方文档其实也非常详细仔细的介绍了 spark-submit 的用法。但是对于 python 的提交提及得非常少,能查阅到的资料非常少导致是有非常多的坑需要踩。 官方文档对于任务提交有这么一段介绍,但是初次使用者依然会非常疑惑: Bundling Your Application’s Dependencies If your code de...

weixin_34192732的博客 1809

【风电功率预测】【多变量输入单步预测】基于BiTCN-LSTM的风电功率预测研究(Matlab代码实现)

【风电功率预测】【多变量输入单步预测】基于BiTCN-LSTM的风电功率预测研究(Matlab代码实现)内容概要:本文研究了基于BiTCN-LSTM的风电功率预测模型,旨在通过多变量输入实现单步预测。该模型结合了双向时间卷积网络(BiTCN)和长短期记忆网络(LSTM),充分利用时间序列数据的前后依赖关系,提升了风电功率预测的精度与稳定性。文章详细介绍了模型的设计原理、结构组成及其实验验证过程,并在Matlab平台上实现了代码开发与仿真测试,展示了其相较于传统方法在处理非线性、波动性强的风电数据方面的优越性能。; 适合人群:具备一定机器学习基础和Matlab编程经验,从事新能源预测、电力系统分析或相关领域研究的研发人员及高校研究生。; 使用场景及目标:①应用于风电场日常运营中的功率预测,提高电网调度的可靠性和经济性;②为研究人员提供一种有效的深度学习融合模型设计思路,用于解决复杂时间序列预测问题;③通过Matlab代码实现,便于快速复现实验并进行算法优化。; 阅读建议:建议读者结合文中提供的Matlab代码,深入理解BiTCN与LSTM的网络架构及其协同工作机制,重点关注数据预处理、模型训练与评估流程,以便更好地掌握该方法在实际工程中的应用技巧。

惠普 ProLiant DL388 Gen9 P440ar raid驱动

源码下载地址: https://pan.quark.cn/s/ef7e735a2758 官方网站的地址为HPE.COM,相关驱动程序同样可以在该网站平台上获取。

分布式电源接入对配电网影响的研究(Matlab代码实现)

内容概要:本文围绕分布式电源接入对配电网的影响展开研究,利用Matlab代码实现相关仿真与分析,重点探讨了分布式电源并网后对配电网电压分布、潮流变化、电能质量及系统稳定性等方面的作用机制。研究通过构建典型配电网模型,结合光伏、风电等分布式电源的出力特性,仿真分析不同渗透率、接入位置和运行方式下的配电网响应,进而评估其影响规律,并提出相应的优化对策与解决方案。文中还可能涉及无功优化、灵敏度分析、智能算法配置等技术手段,以提升配电网对分布式电源的接纳能力。; 适合人群:具备电力系统基础知识,熟悉Matlab/Simulink仿真环境,从事新能源并网、配电网规划与运行等相关领域的科研人员及工程技术人员。; 使用场景及目标:①掌握分布式电源接入对配电网电压、潮流等关键指标的影响规律;②学习基于Matlab的配电网建模与仿真方法;③探索提升配电网稳定性和电能质量的优化配置策略; 阅读建议:建议读者结合文中提供的Matlab代码,逐步复现仿真过程,深入理解模型构建逻辑与算法实现细节,同时可拓展应用于IEEE 33节点等标准测试系统,加强实践能力。

基于iTransformer-BiGRU-KAN多模型融合的滚动轴承剩余寿命预测研究(Python代码实现)

基于iTransformer-BiGRU-KAN多模型融合的滚动轴承剩余寿命预测研究(Python代码实现)内容概要:本文提出了一种基于iTransformer-BiGRU-KAN多模型融合的滚动轴承剩余寿命预测方法,旨在通过结合多种先进深度学习模型的优势,提升在复杂工况下的预测精度与鲁棒性。该方法利用iTransformer捕捉长期时间序列中的全局依赖关系,通过BiGRU模型提取双向时序特征,最后引入KAN(Kernel Attention Network)增强非线性映射与关键特征的自适应加权能力,实现对轴承退化过程的精准建模。文中详细介绍了模型架构设计、训练流程及在公开数据集上的实验验证,结果表明该融合模型相比单一模型在预测精度和稳定性方面均有显著提升。; 适合人群:具备一定机器学习与深度学习基础,从事设备故障诊断、工业大数据分析或智能运维相关领域的研究人员及工程技术人员,尤其适合研究生及以上学历或有相关项目经验的专业人员。; 使用场景及目标:①应用于工业设备状态监测与预测性维护系统中,实现对滚动轴承等关键部件剩余寿命的精准预测;②为复杂时间序列回归任务提供多模型融合的设计思路与技术参考;③推动深度学习在智能制造与工业物联网领域的落地应用。; 阅读建议:建议读者结合Python代码实现部分,深入理解各子模型的接口设计与融合逻辑,重点关注特征融合机制与注意力权重的可视化分析,以便在实际项目中灵活调整与优化模型结构。

20260915-true-21-25 002/003

20260915-true-21-25 002/003

上一篇: Python一亿以内的素数个数_ghpython_素数
下一篇: python 追加写文件_python文件的读写追加等操作
weixin_40002611
博客等级 码龄9年 25粉丝 156原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值