Ceph,health HEALTH_ERR错误

开发者福利!热门AI工具限时免费用 购周边即赠Coding Plan Lite,Claude Code、Cursor等20+工具畅享,效率翻倍! 阅读详情

本来头一天晚上还是正常的ceph存储集群,经历了一个不明真相的夜晚之后启动机器发现集群的健康检查状态已经是HEALTH_ERR了:

[root@node1 ~]# ceph -s
    cluster 056c396d-639c-4312-9ea0-794c92e57329
     health HEALTH_ERR
            38 pgs are stuck inactive for more than 300 seconds
            64 pgs degraded
            38 pgs stuck inactive
            26 pgs stuck unclean
            64 pgs undersized
     monmap e1: 3 mons at {node1=192.168.4.1:6789/0,node2=192.168.4.2:6789/0,node3=192.168.4.3:6789/0}
            election epoch 16, quorum 0,1,2 node1,node2,node3
     osdmap e53: 6 osds: 2 up, 2 in; 64 remapped pgs
            flags sortbitwise
      pgmap v122: 64 pgs, 1 pools, 0 bytes data, 0 objects
            69636 kB used, 20389 MB / 20457 MB avail
                  38 undersized+degraded+peered
                  26 active+undersized+degraded

于是查看了集群内的机器中被使用于集群中的硬盘的所有者和所属组:

[root@node1 ~]# for host in node{1..3}; do ssh $host ls -ld /dev/vdb?; done
brw-rw----. 1 root disk 252, 17 
ceph存储集群发生scrub error后PG验证和repair的方法 1、问题现象:ceph -s查看集群健康状态如下,25个pg发生数据不一致2、ceph health detail查看如下图,这25个PG中的24个共同特点是都包含osd.24,首先处理pg 2.636,以这个为例,验证一下是否数据真的发生了不一致,如果只是遗留的warning,直接repaie就可以3、登陆osd26所在存储节点(可以使用ceph osd find 26查看osd26在哪个存储节... 阅读详情

相关推荐

Ceph PG不一致修复实战:从scrub errors到HEALTH_OK的完整排查手册

本文提供了一份完整的Ceph PG不一致问题排查与修复实战手册。当集群出现scrub errors和inconsistent状态时,文章从诊断不一致的严重程度入手,详细介绍了从执行标准`ceph pg repair`命令到当修复失效时,如何通过重启OSD、硬件层排查、对象级手动修复、PG重映射及使用`ceph-objectstore-tool`进行底层修复等五种进阶解决方案,最终帮助集群恢复至HEALTH_OK状态。

orange的博客 269

Ceph故障排查案例

分布式存储集群的可靠性已经很高,但在大容量集群环境下,出现任何故障都可能带来集群性能问题或者数据安全隐患,因此要做好对集群状态监控及故障恢复。当故障发生后,我们要及时使用正确的处理方式排除故障。

悦分享 664

最全!最完整!部署ceph集群(二)

目标 部署Ceph集群服务器,实现以下目标: 安装部署工具ceph-deploy 创建ceph集群 准备日志磁盘分区 创建OSD存储空间 查看ceph状态,验证 步骤 步骤一:安装部署软件ceph-deploy 1)在node1安装部署工具,学习工具的语法格式。 [root@node1 ~]# yum -y install ceph-deploy [root@node1 ~]# ceph-deploy --help [root@node1 ~]# ceph-deploy mon --help 2)

weixin_49994540的博客 4336

cephHEALTH_ERR 41 pgs are stuck inactive for more than 300 seconds

今天学习ceph部署时,发现集群状态异常猜测:测试添加osd和删除osd时,没有清理干净或者没有使用正确的方法清理。

Entity_G的博客 1146

ceph集群故障

问题:集群状态,坏了一个盘,pg状态好像有点问题 [root@ceph-1 ~]# ceph -s cluster 72f44b06-b8d3-44cc-bb8b-2048f5b4acfe health HEALTH_WARN 64 pgs degraded 64 pgs stuck degraded 64 pgs stuck unclean 64 pgs stuck undersized ...

eagle89的专栏 2835

ceph学习笔记】ceph -s 出现health HEALTH_ERR,pg remapped

背景 查看ceph集群状态的时候出现了ERR错误,报错如下 [root@node1 ceph]# ceph -s cluster 8eaa3f15-0946-4500-b018-6d31d1cc69f6 health HEALTH_ERR clock skew detected on mon.node2, mon.node3 54...

运维少年 3966

重启ceph错误health HEALTH_ERR [56 pgs are stuck inactive for more than 300 seconds]

重启ceph的时候,在配置主管理节点查看ceph的状态的时候报错。报错原因是忘记在node2,node3节点加UDEV规则,使得vdb1和vdb2重启后,属主属组仍然是ceph,在配置的ceph的三个节点加入以下的规则,在重启三台主机。[root@node1~]# vim /etc/udev/rules.d/90-cephdisk.rulesACTION=="add",KERNEL=="vdb[1...

朱海燕的博客日记 3850

Ceph 12 报错:health: HEALTH_ERR 1 scrub errors Possible data damage: 1 pg inconsistent

报错如下: [root@EQUHST00003805 cluster_info]# ceph -s cluster: id: be0e22db-d85d-49db-a20d-dede18b7888e health: HEALTH_ERR 1 scrub errors Possible data damage: 1 pg i...

Mr_Apple 的空间 2143

ceph配置错误 health HEALTH_ERR clock skew detected on mon.node2, mon.node3

错误提示:clock skew detected on mon.node2, mon.node3错误翻译:在mon.node2,mon.node3上检测到时钟偏差错误的原因:控制节点node2,node3没有和相应都时间同步协议服务器同步,在这两台节点上开启相同的服务,如果没有效果则需要等一点时间或者重启第二次后查看。[root@node2 ~]#  systemctl restart chron...

朱海燕的博客日记 7577

Ceph常见问题百科全书

Ceph是目前炙手可热的一个统一分布式存储系统,具有优异的性能、可靠性、可扩展性。其可轻松扩展到数 PB 容量, 支持多种工作负载的高性能(每秒输入/输出操作[IOPS]和带宽),具有极其高的可靠性。Ceph对比HDFS优势在于易扩展,无单点。HDFS是专门为Hadoop这样的云计算而生,在离线批量处理大数据上有先天的优势,而Ceph是一个通用的实时存储系统,具有相当好的超大数量小文件处...

weixin_30906185的博客 471

Ceph 集群状态监控细化

需求 在做Ceph的监控报警系统时,对于Ceph集群监控状态的监控,最初只是简单的OK、WARN、ERROR,按照Ceph的status输出来判断的,仔细想想,感觉这些还不够,因为WARN、ERROR状态中,是包含多种状态的,如果在大晚上收到一条关于Ceph health的报警信息,只知道了集群有问题,但具体是什么问题呢,不得而知。这个事情发生在工作时间,就还好处理,直接到Ceph环境中查看一下

学徒人生 6922

ceph集群报错:HEALTH_ERR 1 pgs inconsistent; 1 scrub errors

报错信息如下:[root@ceph-6-11 ~]# ceph health detailHEALTH_ERR 1 pgs inconsistent; 1 scrub errors; pg 2.37c is active+clean+inconsistent, acting [75,6,35]1 scrub errors报错信息总结:问题PG:2.37cOSD编号:75,6,35执行常规修复:ce...

无锋剑 3182

深入解析Ceph PG不一致问题:从检测到修复的全流程指南

本文深入解析Ceph集群中常见的PG不一致问题,提供从检测到修复的全流程指南。详细解读了scrub errors等报警信息,分析了标准修复命令失效的原因,并给出了从重启OSD到隔离重建、手动删除对象等由简到繁的实战修复方案,帮助运维人员有效保障数据完整性与集群可靠性。

weixin_29038345的博客 468

ceph scrub 错误记录

ceph scrub

Terry Tsang 1159

Ceph分布式存储系统

Ceph Mon维护Ceph存储集群映射的主副本和Ceph存储集群的当前状态,监控器需要高度一致性,确保对Ceph存储集群状态达成一致。ceph存储数据时采用多副本的方式进行存储,生产环境下,一个文件至少要存三份,ceph默认也是三副本存储。创建存储空间,ceph会将硬盘分为两个分区,一个分区大小为5GB,用于ceph的内部资源,另一个分区是剩余的全部空间。3、创建文件系统new后面第一个表示要创建文件系统的名字,第二个存储池用来存储元数据,第三个存储池用来存储数据,创建完查看存储池。

qq_62414482的博客 1237

Ceph集群与Ceph块存储

文章目录Ceph集群与Ceph块存储实验环境准备方案为虚拟机添加磁盘:所有主机设置防火墙和SELinux(如果已经关闭,则此步骤可以忽略)配置无密码连接(包括自己远程自己也不需要密码),在node1操作。修改/etc/hosts并同步到所有主机。修改所有节点都需要配置YUM源,并同步到所有主机。给所有节点安装ceph相关软件包。Client主机配置NTP服务器。node1,node2,node3修改NTP客户端配置。部署Ceph集群安装部署软件ceph-deploy在node1安装部署工具,学习工具的语法格

m0_57261942的博客 496

Ceph集群故障处理 - PG不一致修复

Ceph集群故障处理 - PG不一致修复

mixboot 2117
上一篇: Python,Non-ASCII character '\xef'错误
下一篇: rbd: strict_strtoll: garbage at end of string. got: '10G'错误
肓己
博客等级 码龄10年 43粉丝 74原创
评论 1
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值