我目前正在研究corosync来build立一个双节点集群。 所以,我已经做得很好,它做我想做的,这是: 两个节点之间丢失的连接使得第一个节点的“10node”都是故障切换WAN IP。 (又名资源WanCluster100和WanCluster101) “11节点”什么都不做。 他“认为”他仍然有他的故障转移湾IP。 (又名WanCluster101) 但它不这样做: 当与其他节点的连接恢复时,'11节点'应该重新启动WanCluster101资源。 这是为了防止节点10简单地死亡(并且因此不获得11节点的故障转移Wan IP)的情况,导致没有节点具有10节点的故障转移IP的情况,因为10节点处于closures状态。11节点已经“给出”其故障转移Wan IP。 这是当前正在configuration的configuration。 node 10sch \ attributes standby="off" node 11sch \ attributes standby="off" primitive LanCluster100 ocf:heartbeat:IPaddr2 \ params ip="172.25.0.100" cidr_netmask="32" nic="eth3" \ op monitor interval="10s" \ meta is-managed="true" target-role="Started" primitive LanCluster101 ocf:heartbeat:IPaddr2 \ params ip="172.25.0.101" cidr_netmask="32" nic="eth3" \ op monitor interval="10s" \ meta is-managed="true" […]
我目前正在研究Postgres HA 1 Master / 1 Slave场景的部署体系结构。 在阅读了大量的文档之后,我决定在Ubuntu LTS上开始使用Pacemaker和Corosync。 目前我不清楚Corosync和Pacemaker是否应该在实际的数据库主机上运行,或者在专门用于pipe理实际集群节点的节点上运行。 有人能教导我吗?
两个使用CentOS 6.6的Zabbix 2.4服务器和一个外部MySQL DB,两台服务器都被configuration为在运行时连接到这个数据库。 我遵循了Zabbit高可用性指南和Clusterlabs的快速入门的组合 。 我想我已经完成了设置,因为当我执行故障转移(node1到node2)时,虚拟IP被分配给活动节点,并且zabbix-server服务也开始运行。 但是,Web界面说Zabbix服务器没有运行。 我在日志文件中看不到任何错误或警告。 当我回到node1时,一切都很好,web ui说zabbix服务器正在运行。 *********** This is the node where Zabbix server is fine [root@zabbixserver3 ~]# netstat -ntap | grep 10051 tcp 0 0 0.0.0.0:10051 0.0.0.0:* LISTEN 14880/zabbix_server tcp 0 0 10.99.99.93:38034 10.99.99.93:10051 TIME_WAIT – tcp 0 0 10.99.99.93:38032 10.99.99.93:10051 TIME_WAIT – tcp 0 0 10.99.99.93:38022 10.99.99.93:10051 TIME_WAIT […]
我试图通过drbd和fiesystem在Ubuntu 14.04上启动postgres服务器。 服务状态如下: Last updated: Mon Mar 14 01:16:45 2016 Last change: Mon Mar 14 01:05:53 2016 via cibadmin on node1 Stack: corosync Current DC: node2 (2) – partition with quorum Version: 1.1.10-42f2063 2 Nodes configured 5 Resources configured Online: [ node1 node2 ] Master/Slave Set: ms_drbd [drbd_postgres] Masters: [ node1 ] Stopped: [ node2 […]
我已经configurationcorosync,然后我得到这些问题0节点和0资源configuration。 [root@sitampan2 verdana]# crm status Stack: unknown Current DC: NONE Last updated: Thu Jun 16 15:15:40 2016 Last change: Wed Jun 15 14:25:43 2016 by root via cibadmin on sitampan2 0 nodes and 0 resources configured: 160547800 resources DISABLED and 4352 BLOCKED from being started due to failures Full list of resources: 这是我的corosyncconfiguration: compatibility: whitetank […]
我在CentOS 7上创build了两个节点: node1:192.168.0.1 node2:192.168.0.2 安装了这样的工具: # yum install -y pacemaker corosync pcs crmsh 还用HAProxy做负载均衡器。 在我做好所有事情之后,我重新启动node1以testing高可用性。 当node1启动时,从这个方式只能看到一个节点: # pcs status corosync 这可以看到两个节点: # crm status 但另一个是UNCLEAN ! Stack: corosync Current DC: node1 (version 1.1.15-11.el7_3.5-e174ec8) – partition WITHOUT quorum 2 nodes and 0 resources configured Node node2: UNCLEAN (offline) Online: [ node1 ] No resources 从node2到检查状态,另一个是UNCLEAN ! […]
那么我正在设置一个正在运行的Linux-HA群集 *起搏器1.1.5 * OpenAIS的-1.1.4 *多path工具-0.4.9 * OpenSuSE 11.4,内核2.6.37 群集configuration通过LinBit的健康检查,所以我对此非常有信心。 多path正在使用,因为我们有一个LSI SASarrays通过2个HBA连接到每个主机(每个主机总共4条path)。 我现在想要做的是通过从多path设置中删除path来testing故障转移function。 多径path如下: pgsql-data (360080e50001b658a000006874e398abe) dm-0 LSI,INF-01-00 size=6.0T features='0' hwhandler='1 rdac' wp=rw |-+- policy='round-robin 0' prio=0 status=active | |- 4:0:0:1 sda 8:0 active undef running | `- 5:0:0:1 sde 8:64 active undef running `-+- policy='round-robin 0' prio=0 status=enabled |- 4:0:1:1 sdc 8:32 active undef running […]
所以我在使用STONITH和双节点DRBD / Pacemaker / Corosync集群来复制MySQL数据时看到了很多冲突的观点。 我可以在Pacemaker网站find的例子似乎closures了,但很多其他地方说,你应该保持它…..我的设置将是2个节点与2个接口,一个物理连接到另一台机器,另一个连接到一个开关。 在这种情况下,如果我有冗余的通信是STONITH必要的? 如果一台服务器失去了两个networking连接,它将不会收到任何MySQL数据,当它恢复时,我打算将粘性设置为无限,所以它(不应该)不会成为主人。 在这种情况下,STONITH是必要的还是可取的?
我目前正在尝试使用以下命令在主动/主动configuration中configuration一对负载平衡服务器: Nginx的 Corosync 起搏器 遵循从头开始的适用说明。 但是,我不知道群集是否在基于以下crm_mon输出的主动 – 主动configuration中运行。 任何提示或build议将不胜感激。 ============ Last updated: Mon Oct 29 16:58:32 2012 Last change: Mon Oct 29 11:06:38 2012 via cibadmin on test2 Stack: openais Current DC: test2 – partition with quorum Version: 1.1.7-6.el6-148fccfd5985c5590cc601123c6c16e966b85d14 2 Nodes configured, 2 expected votes 2 Resources configured. ============ Online: [ test2 test ] Clone […]
我正在build立一个基于CMAN + Pacemaker集群堆栈的双节点集群,但是我没有硬件STONITH设备。 但是,两个节点通过iSCSI连接到共享存储,我想用这个来用SBD进行屏蔽。 SBD由OpenAIS和Heartbeat支持,我已经使用了SBD和Heartbeat + Pacemaker集群堆栈,但是现在我需要使用CMAN。 因此,我已经添加了一些代码CMAN的初始化脚本来启动/停止SBD,它似乎工作正常。 关于看门狗:强烈build议使用看门狗运行SBD。 SBD是这种集群中的关键服务,并且必须在集群软件运行时始终运行。 看门狗有助于确保 – 如果由于某种原因,SBD过程意外终止,则狗不再受到喂食,并重新启动节点。 所以我在开始SBD之前就得到了看门狗内核模块softdog加载(就像在Heartbeat中)。 简单地说,我在/etc/init.d/cman中执行以下操作: 加载内核模块 – modprobe softdog 启动SBD – sbd -d <device> -D -W watch 这里是问题: 当我手动启动cman service cman start 一切正常,但是当cman在启动时自动启动,节点重新启动。 看起来好像看门狗没有被馈送,因为在SBD(14:21:29)初始化节点( <watchdog timeout> )之后,节点正好被隔离了<watchdog timeout>秒(5s),但是日志(/ var / log /系统日志)是有争议的,说SBD运行: Jan 15 14:21:28 cs-node1内核:[12.341755] softdog:软件看门狗定时器:0.08初始化。 soft_noboot = 0 soft_margin = 60秒soft_panic = 0(nowayout […]