ceph数据recovery配置策略

开发者福利!热门AI工具限时免费用 购周边即赠Coding Plan Lite,Claude Code、Cursor等20+工具畅享,效率翻倍! 阅读详情

1、背景
在ceph集群中,如果ceph集群出现OSD的out或者in(增加、删除、上线、下线OSD等情况),最终都会导致ceph集群中的数据迁移及数据重建,数据迁移及重建会占用一部分网络带宽及磁盘带宽,此时就可能导致出现block(阻塞)现象。
2、场景

场景一:优先保证recovery带宽;
在对数据安全性要求比较高的场景下,为了保证数据副本的完整性以及快速恢复存储集群的健康,会优先保证数据恢复带宽,此时需要提升recovery的I/O优先级,降低client的I/O优先级,具体操作如下(在ceph任意一个节点或客户端运行即可)

提升recovery的I/O优先级(12.0.0版本默认recovery的I/O优先级为3)

ceph tell osd.* injectargs "--osd_recovery_op_priority 63"

降低client的I/O优先级(12.0.0版本默认recovery的I/O优先级为63)

ceph tell osd.* injectargs "--osd_client_op_priority 3"

待recovery完成,需要还原配置

ceph tell osd.* injectargs "--osd_recovery_op_priority 3"
ceph tell osd.* injectargs "--osd_client_op_priority 63"

场景二:优先保证client带宽;
在对数据安全性要求不是很高的场景下,为了降低对用户体验的影响,会优先对client的I/O优先级及带宽进行保证,此时需要降低recovery的I/O优先级及带宽,具体操作如下:

降低recovery的I/O优先级(12.0.0版本默认recovery的I/O优先级为3)

ceph tell osd.* injectargs "--osd_recovery_op_priority 1"
ceph之rados设计原理与实现第七章:在线数据恢复——Recovery和Backfill 由于每个写操作都需要产生和操作日志,所以处于效率考虑,必须定时对日志进行裁剪。由于PG保存的日志条目有限,按照能否依靠日志进行数据恢复,存在两种数据恢复方式,分别为Recovery和Backfill。Recovery指只需要修复副本(PG)上与权威日志不同步的那部分对象(即降级对象即可)。missing已经记录Backfill指以PG全体对象为目标的数据迁移过程。例如所在OSD离线太久而期间产生大量客户端发起的读写请求,或者Ceph自身出于数据重平衡需要而执行Backfill。 阅读详情

相关推荐

Ceph Recovery分析

1.ceph recovery 概述2.相关变量及函数3.线程池与工作队列4. Ceph PGQueable5.Bufferlist及序列化6.Recovery 流程 1.ceph recovery 概述 当PG完成了Peering过程后,处于Active状态的PG就已经可以对外提供服务了。如果该PG的各个副本上有不一致的对象,就需要进行修复。Ceph的修复过程有两种:Recovery

redenval的专栏 4411

如何加快或减慢 osd 恢复

本文档根据本文档末尾的提供。

HHFQ的博客 1487

ceph性能优化

1.服务器2.内存3.硬盘4.网卡5.使用raid卡6.万兆交换机。

weixin_43493709的博客 2582

ceph 数据恢复和回填速度 重建osd 加快数据恢复

ceph 数据恢复和回填速度 重建osd 加快数据恢复

mixboot 2905

CEPH集群日常运维必看:5个被低估的OSD参数及其对性能的影响

本文深入解析CEPH集群运维中五个常被低估的OSD参数,包括osd_recovery_max_active、osd_max_backfills等,通过实测数据展示它们对集群性能的关键影响。文章提供具体配置建议和优化案例,帮助管理员实现CEPH配置优化,提升故障恢复速度和业务连续性。

pytorch8learner的博客 170

Ceph存储集群数据迁移与平衡参数调优指南

分布式存储系统中,数据迁移与平衡是保障集群可靠性和性能的核心机制。通过控制数据重构、恢复、回填和重平衡等操作,可以优化存储资源利用率并减少业务影响。Ceph作为主流开源分布式存储系统,其内置的osd_max_backfills、osd_recovery_max_active等参数可精细调节迁移速率与优先级。合理配置这些参数能在华为云等生产环境中实现迁移效率提升3-5倍,同时将业务延迟控制在10%以内。本文结合全闪存集群调优实践,详解如何通过ceph tell命令动态调整网络带宽、并发任务数等关键参数,并分享

weixin_31292729的博客 253

cephCeph之PG状态详解--研读笔记

原文:分布式存储Ceph之PG状态详解 - 简书 1. PG介绍 继上次分享的《Ceph介绍及原理架构分享》,这次主要来分享Ceph中的PG各种状态详解,PG是最复杂和难于理解的概念之一,PG的复杂如下: 在架构层次上,PG位于RADOS层的中间。 a. 往上负责接收和处理来自客户端的请求。 b. 往下负责将这些数据请求翻译为能够被本地对象存储所能理解的事务。 是组成存储池的基本单位,存储池中的很多特性,都是直接依托于PG实现的。 面向容灾域的备份策略使得一般而言的PG需要执行跨节点的分布式写

我的笔记本 1万+

ceph - 故障测试 [目标: 延时自动执行 RECOVERY]

避免 ceph 在故障时候自动执行 RECOVERY 功能 需要人工介入执行 RECOVERY 周期

Terry Tsang 2119

ceph配置文件

#控制是否可以复用osd创建资源池。0、不支持复用,1、支持复用 $osd_reuse = 0; #系统剩余内存水线,单位:% $system_free_memory_limit = 60; #osd内存使用水线,单位:KB $osd_memory_limit = 2097152; #bluestore_cache_other使用水线,单位:byte $blu_cache_other_limit ...

qq_23929673的博客 2725

Ceph OSD 故障运维手册

Ceph 的分布式存储系统中,数据以 PG 为单位分布在多个 OSD 上。一个 PG 的数据通常有多个副本(例如 size=3 的池需要 3 个 OSD 存储主副本和两个副本)。这些共同承载同一个 PG 的 OSD 互为“邻居”。例如,如果 PG 4.0 的 up 集合是 [osd.2, osd.6, osd.10],那么 osd.2 的“邻居”是 osd.6 和 osd.10,无论它们位于同一主机还是不同主机。

运维老生常谈 1496

[转]ceph RADOS----概述

[转自 https://yq.aliyun.com/articles/89942] 本节书摘来自华章出版社《Ceph源码分析》一书中的第1章,第1.5节RADOS,作者常涛,更多章节内容可以访问云栖社区“华章计算机”公众号查看 1.5 RADOSRADOS是Ceph存储系统的基石,是一个可扩展的、稳定的、自我管理的、自我修复的对象存储系统,是Ceph存储系统的核心。它完成了一个存储系...

weixin_30268071的博客 495

CEPH架构总体说明

文章目录1. Ceph架构说明1.1 整体架构图1.2 接口类型1.2.1 RBD1.2.2 CephFS1.2.3 RadosGW1.3 RADOS2. RADOS概念介绍2.1 Monitor2.2 RADOS对象存储2.3 pool和PG2.4 对象寻址过程2.5 对象读写2.6 数据均衡2.7 Peering2.8 Recovery&Backfill2.9 纠删码2.10 快照和克隆2.11 Cache Tier2.12 scrub3. 参考资料 1. Ceph架构说明 1.1 整体架构图

手边笔记 1223

手把手图解:当硬盘挂了,Ceph里的4+2纠删码是怎么把数据救回来的?

本文详细解析了Ceph分布式存储系统中4+2纠删码(EC)在硬盘故障时的数据恢复机制。通过对比多副本方案,深入讲解EC如何通过数学冗余实现高效存储和快速恢复,包括故障检测、降级读处理和后台自动修复流程,并提供了性能优化和监控配置的实用技巧。

weixin_30781433的博客 382

Ceph常见问题

1.nearfull osd(s) or pool(s) nearfull 此时说明部分osd的存储已经超过阈值,mon会监控ceph集群中OSD空间使用情况。如果要消除WARN,可以修改这两个参数,提高阈值,但是通过实践发现并不能解决问题,可以通过观察osd的数据分布情况来分析原因。 (1)配置文件设置阈值 “mon_osd_full_ratio”: “0.95”, “mon_osd_nearf...

屈帅波的技术博客 2034

Ceph存储集群数据迁移与平衡参数优化指南

分布式存储系统中,数据迁移与平衡是保障集群稳定性的核心技术。通过调整Recovery、Backfill等核心参数,可以显著提升数据重构效率并降低对业务IO的影响。本文基于PB级Ceph集群运维经验,详细解析osd_recovery_max_active、osd_backfill_full_ratio等关键参数的调优策略,涵盖HDD/SSD差异化配置、网络带宽限制等实战技巧,帮助运维人员实现迁移效率提升3-5倍的同时将业务影响控制在10%以内。

weixin_32288959的博客 231

Ceph 18(Reef)生产级调优手册

Ceph 18(Reef)生产级调优手册

牛牛博士博客 652

一次硬盘故障恢复实录:带你看清Ceph里EC纠删码的完整‘自愈’过程

本文详细记录了Ceph集群在硬盘故障时的EC纠删码自愈过程,从故障检测到数据恢复的全流程。通过真实案例展示了EC 4+2配置如何实现优雅降级和无缝自愈,包括降级模式下的数据访问机制、恢复流程的精细控制以及业务IO与恢复流量的平衡策略

weixin_30791095的博客 295

Ceph源码分析》——第1章,第5节RADOS

本节书摘来自华章出版社《Ceph源码分析》一书中的第1章,第1.5节RADOS,作者常涛,更多章节内容可以访问云栖社区“华章计算机”公众号查看 1.5 RADOSRADOS是Ceph存储系统的基石,是一个可扩展的、稳定的、自我管理的、自我修复的对象存储系统,是Ceph存储系统的核心。它完成了一个存储系统的核心功能,包括:Monitor模块为整个存储集群提...

weixin_34413103的博客 370
上一篇: 使用ceph-ansible完成ceph L版本的部署
下一篇: openstack关闭安全组(网络端口)的限制
Mr-li-李
博客等级 码龄10年 3粉丝 21原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值