作者:范军 Frank Fan) 新浪微博:@frankfan7
一 为什么使用HA
高可用性是虚拟化平台最突出的特性之一,设置和维护非常简单,技术非常成熟。对于一些非常关键的应用,可能对容灾的要求特别高,可以考虑采用基于应用层的HA,或者操作系统层的HA,比如MSCS。虚拟层的HA是在底层架构上实现的高可用性,在恢复时间可接受的情况下是非常好的选择。
相对应用层和操作系统层HA而言,vSphere HA以较低的成本实现了整个集群的高可用性,同时实施和维护都十分的简单。无需在应用或者VM上作任何设置或改动。
二 HA是如何工作的?
HA Agent
vSphere5.0之后的版本对架构作了很多的改动。摒弃了原来Cluster中的Primary Node和Secondary Nodes的概念。并且引入了Master HAagent 和 Slave HA Agent的概念。通常情况下一个Cluster中仅有一个Master HA Agent。HA Agent有以下的功能:
-与vCenter互相交换信息
-Master HA Agent监控VM的状态,在其出现问题时重启
-Slave HA Agent把VM的状态信息传递给Master HA Agent, 并且在MasterAgent 的指令下重启VM
-检测VM上运行的应用的状态
当Master HA所在的主机出现问题时,其他主机上的Agent开始参与竞选成为MasterHA, 连接DataStore数目最多的主机会成为Master。如果两台主机DataStore数目相同,Managed Object Id较高的主机会成为Master。
HeartBeating
用来判断主机是否仍然正常运行。
Network Heartbeating
每台Slave都和Master主机互相发送Heartbeat信息。
Datastore Heartbeating
有的情况下Management网络中断之后,如果VM还能够继续访问其他网络和存储,那么就无需对被隔离主机上的VM采取响应措施。这是就需要检测Datastore Heartbeating来进一步验证。
对于Converged Infrastructure,比如Cisco UCS等系统,Datastore Heartbeating能起的作用不大,因为管理网络和存储共用物理链路,在管理网络中断的情况下,存储很可能也无法访问了。
主机隔离
检测: 在某个主机无法与Management Network通讯时,也就是ping isolation Address失败后,该主机会被认为处于隔离状态。 Management Network的网关缺省作为isolationAddress。 为了增加可靠性和避免误判,可以设置多个isolationAddress
响应:
下面的分析帮助你在确认主机处于隔离状态后,选择合适的响应动作
主机可以访问VM DataStore的可能性 | 可以访问VM网络的可能性 | 建议的响应动作 | 理由 |
可能 | 可能 | Leave Powered On |
您可能想查找下面的文章: |

