hadoop-3.0.0-beta1运维手册(011):HDFS Erasure Coding纠删码使用

Ceph 进阶系列(四):Ceph的特性 EC(Erasure Code) 从GitHub上Clone Ceph项目,我是基于(ceph version 12.2.11 luminous 版本)的代来分析的 一、EC(Erasure Code)是什么? Ceph的特性EC:将写入的数据分成N份原始数据,通过这N份原始数据计算出M份效验数据。把N+M份数据分别保存在不同的设备或者节点中,并通过N+M份中的任意N份数据块还原出所有数据块。EC包含了编和解两个过... 阅读详情

写在前面的话

Hdfs采用分布式架构,为上层的应用和用户提供可扩展、高吞吐、高可靠的数据存储服务。在整个Hadoop生态系统中,hdfs处于最底层,也是最无可替代的一个基础设施。从2008hadoop-0.10.1版本开始到现在的hadoop-3.0.0-beta1hdfs已经走过了近10个年头,其架构和功能特性也发生了巨大的变化。特别是hdfs3.0.0系列,和hdfs2.x相比,增加了基于纠删码(erasure encoding)的容错方式,与传统的副本方式相比,在同等可用性的情况下, 能大幅节省一半以上的空间,这也是自hdfs诞生近这十年来,数据可靠性机制上的一个重大变化(之前一直都是副本容错方式)。此外hdfs3.0.0还增加了其它的一些特性,例如在Namenode HA中支持3Namenode,可以容忍2Namenode失效,而hdfs2.x只能容忍1Namenode失效。

本文以连载的方式,在大数据学习网”上记录自己使用hadoop-3.0.0-beta1hdfs的点点滴滴,包括从零开始搭建分布式hdfs3.0,如何动态扩展hdfs节点、如何使用hdfs3.0的纠删码容错等等。不当之处,请大家发邮件aishuc@126com给艾叔,谢谢!

 

本节我们将演示如何使用hdfs3.0的纠删码功能,纠删码是hdfs3.0新加入的功能,之前的hdfs都是采用副本方式容错,默认情况下,一个文件有3个副本,可以容忍任意2个副本(datanode)不可用,这样提高了数据的可用性,但也带来了2倍的冗余开销。例如3TB的空间,只能存储1TB的有效数据。而纠删码则可以在同等可用性的情况下,节省更多的空间,以rs-6-3-1024K这种纠删码策略为例子,6份原始数据,编码后生成3份校验数据,一共9份数据,只要最终有6份数据存在,就可以得到原始数据,它可以容忍任意3份数据不可用,而冗余的空间只有原始空间的0.5倍,只有副本方式的1/4,因此,可以大大节约成本。

由于编码出来的数据,要分布到多台datanode上,例如rs-6-3-1024K,就需要至少6+3=9datanode,我们目前只有2datanode,因此还需要扩充7datanode。下面的的操作就是,先扩充datanode,然后演示如何进行纠删码操作。

6.1 复制datanode节点、并动态加入 

由于纠删码要用到多个节点,我们复制dn1,构建10datanode,分布从dn2~dn9,每个datanode的内存配置为256MBIP地址从192.168.182.13~192.168.182.20

A. 每个datanode上要做的事情

1. 修改虚拟机名、主机名

2. 修改网络配置

3. 添加hosts解析

 

4. 清除datanode存储目录下的文件

5. 虚拟机内存调整位256MB

注意:打开虚拟机时,一定要选择I copied it

 

B. nn1上要做的事情:</

云原生大数据架构实践:Flink+Iceberg+eBPF工程化落地 云原生大数据并非简单将Hadoop组件容器化,而是以Kubernetes为底座、以声明式控制面重构数据基础设施的核心范式。其本质是通过Operator治理计算生命周期、Service Mesh实现跨集群血缘追踪、GitOps驱动Schema演进,并借助eBPF等轻量可观测技术替代传统Agent。该架构显著提升Flink实时作业的弹性扩缩容能力与Checkpoint稳定性,支撑Iceberg数据湖在S3兼容存储上的高性能分区裁剪与小文件治理。适用于正从YARN/HDFS向K8s迁移、面临ETL链路割裂、多团队 阅读详情

相关推荐

hadoop3 EC测试

Hadoop 3.0 技术分析(Erasure Coding) 背景 随着大数据技术的发展,HDFS作为Hadoop的核心模块之一得到了广泛的应用。为了数据的可靠性HDFS通过多副本机制来保证。在HDFS中的每一份数据都有两个副本,1TB的原始数据需要占用3TB的磁盘空间,存储利用率只有1/3。而且系统中大部分是使用频率非常低的冷数据,却和热数据一样存储3个副本,给存储空间和网络带宽带来了很大的压力。因此,在保证可靠性的前提下如何提高存储利用率已成为当前HDFS面对的主要问题之一。 Hadoo

sinat_22510827的博客 1361

【信息科学与工程学】计算机科学与自动化—第十五篇 云计算 11 算法篇02

但若第一个应用需求40GB/s,第二个10GB/s,总需求50GB/s>40GB/s,第一个得32GB/s,第二个得8GB/s,不公平。但若分区负载不均(分区1-2各有100任务/s,分区3-4各有50任务/s),A负责1-2(200/s),B负责3-4(100/s),仍均衡。任务 τi​ 的计算需求 Wi​(CPU周期),在频率 f 下执行时间 Ti​=Wi​/f,能耗 Ei​=Pdyn​⋅Ti​=Ceff​⋅V2⋅f⋅(Wi​/f)=Ceff​⋅V2⋅Wi​。若 Mneed​>Mi​,需使用远程显存。

weixin_49199313的博客 43

【信息科学与工程学】【数据科学】第一百二十二篇 大数据产品中的函数与算法01

它通常指。下面按照你给出的表格列💡 说明:下表中的"产品"以开源/主流商业组件为具象载体(Hadoop、Spark、Flink、Kafka、Hive、HBase、Iceberg、Atlas、Ranger、TensorFlow 等),它们共同构成一个完整的大数据产品家族;代为实现示例,用于说明算法在工程系统中的落地方式。

weixin_49199313的博客 180

Hadoop算法启用ISA-L加速库

在前文HDFSErasureCoding)一文中提到,HDFS启用ISA-L存储加速库,有有助于提升HDFS的编和解效率。 版本说明如下: 软件 版本 Hadoop 3.1.0 isa-l 2.28.0 nasm 2.14.02 yasm 1.2.0 启用ISA-L步骤如下: 安装yasm和nasm 在Hadoop集群所...

znb769525443的专栏 3227

分布式存储系统 | Erasure Coding),以Reed-Solomon(RS)为例

Erasure Code)浅析。Reed-Solomon(RS)是存储系统较为常用的一种,它有两个参数n和m,记为RS(n,m)。n代表原始数据块个数。m代表校验块个数

南意的博客 5445

ceph源分析--isa-l计算校验块的一个小优化

本次来聊一聊isa-l,即ceph的插件之一。当然这个值曾经默认是jerasure。 关于的原理其实就像是线性代数中解线性方程组。这部分就不赘述。本次重点关注isa-l中的两个函数。 本次主要关心的问题: 在已经知道旧的校验块后和旧的数据块和修改后的数据块后怎么快速得到新的校验块。 首先isa-l库是可以独立单独运行的,首先从 https://github.com/ceph/...

SY_Yu的博客 3323

什么是(与的区别)|与副本对比|LDPC

在信息中按照某种规则加上一定的冗余位,构成一个字,称为差错控制编过程。在接收端接收到字,或从存储设备中读取字后,查看。

顺其自然~专栏 2458

hadoop-3.0.0-beta1运维手册011):HDFS Erasure Coding

转自:https://blog.csdn.net/aishuc/article/details/78734572 Hdfs采用分布式架构,为上层的应用和用户提供可扩展、高吞吐、高可靠的数据存储服务。在整个Hadoop生态系统中,hdfs处于最底层,也是最无可替代的一个基础设施。从2008年hadoop-0.10.1版本开始到现在的hadoop-3.0.0-beta1hdfs...

weixin_33819479的博客 388

存储加速&加密(一)--------ISA-L

ISA-L 存储加速

qq384885956的博客 2083

go技术文章梳理(2018)

gocn_news_2018-12-31 Go 入门简介:http://t.cn/EbjzeSt Go GraphQL 新手指南: https://tutorialedge.net/golang/go-graphql-beginners-tutorial/ 你需要 Go web 框架吗:https://medium.com/@tusharsoni/do-you-need-a-...

韩亚军的博客 21万+

Intel Intelligent Storage Acceleration Library (ISA-L) 常见问题解决方案

Intel Intelligent Storage Acceleration Library (ISA-L) 是英特尔开发的一个开源库,旨在为存储应用提供优化后的低级功能。该项目主要使用 C 语言编写。 ## 1. 项目基础介绍 ISA-L 是一组针对存储应用优化的低级函数集合,包括如下功能: - ****:快速块状里德-所罗门类型,适用于任何 GF(2^8)/解矩阵。 - ...

gitblog_00521的博客 766

高性能

高性能

weixin_39094034的博客 866

利用联合局域性实现分布式存储中的宽条擦除编(附代

分布式存储系统中一种低成本的冗余机制,通过存储条纹数据和奇偶校验块。宽条纹最近被提出来抑制奇偶校验块在条带中的比例,以达到极大的存储节省。然而,宽条纹加重了修复损失,而现有的方法不能有效地解决宽条纹问题。在本文中,我们提出了联合局部性,这是第一个通过奇偶局部性和拓扑局部性的结合来系统地解决宽条纹修复问题的机制。我们使用高效的编和更新方案进一步增强组合局部性。在Amazon EC2上的实验表明,与基于局部性的最先进技术相比,基于组合局部将单块修复时间减少了90.5%,而冗余度仅为1.063×。

weixin_42014594的博客 803

GlusterFS企业级功能之EC

转载自: http://www.taocloudx.com/index.php?a=shows&catid=4&id=68在这个数据爆炸的时代,很多行业不得不面临数据快速增长的挑战,为了应对呈爆炸式增长态势的数据量,构建大规模的存储系统成了一种普遍的应用需求。但数据是如此重要,如何保证存储可靠性、数据可用性成了大规模存储系统的难点和要点。数据冗余是保障存储可靠...

weixin_34290096的博客 495

Hadoop

1.hdfs命令 hdfsdfs -linux命令 操作是一样的 hadoopfs <==>hdfs dfs 等价的 2.查看当前版本 压缩情况 [ssn@localhost hadoop]$ hadoop checknative 2021-12-17 04:32:58,241 INFO bzip2.Bzip2Factory: Successfully loaded & initialized native-bzip2 library system-native ...

ssn520的博客 786

mac 下编译hadoop3.1.2

使用brew安装的hadoop默认版本使用时总是提示 WARN util.NativeCodeLoader: Unable to load native-hadoop library for your platform... using builtin-java classes where applicable 不能忍,简单方法修改hadoop log level,永久方法是 自己重新编...

一鸣惊人的专栏 2089

Hadoop3数据容错技术(

背景 随着大数据技术的发展,HDFS作为Hadoop的核心模块之一得到了广泛的应用。为了数据的可靠性HDFS通过多副本机制来保证。在HDFS中的每一份数据都有两个副本,1TB的原始数据需要占用3TB的磁盘空间,存储利用率只有1/3。而且系统中大部分是使用频率非常低的冷数据,却和热数据一样存储3个副本,给存储空间和网络带宽带来了很大的压力。因此,在保证可靠性的前提下如何提高存储利用率已成为当前HDFS面对的主要问题之一。Hadoop 3.0 引入了技术(Erasure Coding),它可以提高..

张伟的专栏 2062
上一篇: hadoop-3.0.0-beta1运维手册(010):hdfs3.0.0动态添加节点(2)
下一篇: 艾叔:Scala编程基础入门教程(001)-Scala和Java比较、Scala对于初学者的缺点
艾叔
博客等级 码龄11年 15粉丝 16原创
评论 3
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值