ORACLE RAC环境下节点自动重启问题总结

您的位置：
门户
>> 文章精选
>> 软件开发专栏
>> 数据库
>> 查看资讯

ORACLE RAC环境下节点自动重启问题总结

发表于：2014-9-09 10:17

字体：大中小 | 上一篇 | 下一篇 | 我要投稿

作者：dayong2015 来源：51Testing软件测试网采编

软件开发

数据库

Oracle

　　首先我们对能够导致节点重启的CRS进程进行介绍。

　　1.ocssd : 它的主要功能是节点监控（Node Monitoring）和组管理(Group Management),它是CRS的核心进程之一。节点监控是指监控集群中节点的健康状况，监控的方法是通过网络心跳(network heartbeat)和磁盘心跳（disk heartbeat）实现的，如果集群中的节点连续丢失磁盘心跳或网络心跳，该节点就会被从集群中驱逐，也就是节点重启。组管理导致的节点重启，我们称之为node kill escalation（只有在11gR1以及以上版本适用）。重启需要在指定的时间（reboot time,一般为3秒）内完成。

　　网络心跳:ocssd.bin进程每秒钟向集群中的各个节点通过私网发送网络心跳信息，以确认各个节点是否正常。如果某个节点连续丢失网络心跳达到阀值，misscount（默认为30秒，如果存在其他集群管理软件则为600秒），集群会通过表决盘进行投票，使丢失网络心跳的节点被主节点驱逐出集群，即节点重启。如果集群只包含2个节点，则会出现脑裂，结果是节点号小的节点存活下来，即使是节点号小的节点存在网络问题。

　　磁盘心跳：ocssd.bin进程每秒钟都会向所有表决盘（Voting File）注册本节点的状态信息，这个过程叫做磁盘心跳。如果某个节点连续丢失磁盘心跳达到阀值disk timeou(一般为200秒)，则该节点会自动重启以保证集群的一致性。另外，CRS只要求[N/2]+1个表决盘可用即可，其中N为表决盘数量，一般为奇数。

　　2.oclsomon：这个进程负责监控ocssd是否挂起，如果发现ocssd.bin存在性能问题，则重启该节点。

　　3.oprocd：这个进程只在Linux和Unix系统，并且第三方集群管理软件未安装的情况下才会出现。如果它发现节点挂起,则重启该节点。

　　批注：以上所有进程都是由脚本init.cssd产生。

　　一般诊断节点重启问题是经常搜集的信息。

　　1)．操作系统日志

　　2)．<crs主目录>/log/<节点名称>/cssd/ocssd.log

　　3)．oprocd.log(/etc/oracle/oprocd/*.log.* 或 /var/opt/oracle/oprocd/*.log.*)

　　4)．<crs主目录>/log/<节点名称>/cssd/oclsomon/oclsomon.log

　　5). Oracle OSWatcher 报告

　　下面结合自己的RAC环境出现节点重启问题进行分析：

　　查询节点1的oprocd.log，如下：