我有一个监控〜30个Windows服务器的nagios服务器设置。 我想添加一些趋势图表。 我读过nagiosgraphics插件很简单 ,许多人使用独立的,独立的图表/趋势工具。 nagiosgraphics插件与独立产品(如ganglia / munin / cacti)有什么限制? 我对独立软件包提供的特定function和优势感兴趣,而nagios绘图插件则没有。
我正在开始一个新的项目,并考虑使用Ansible或Salt来实现部署自动化,或者更复杂的编排(服务器pipe理和联合)。 用Salt我想知道是否有任何与Graphite或Zenoss或Ganglia之间的集成…使用Salt 0mq连接将数据从Salt“ minions”转发到监视/graphics数据库/收集器。 有没有其他人看过这个?
Glusterfs虽然是一个很好的分布式文件系统,但几乎没有办法监视它的完整性。 服务器可以来来去去,砖块可能会陈旧或者失败,我恐怕知道这个可能太晚了。 最近我们有一个奇怪的失败,当一切都显现出来的时候,却有一块砖块掉了下来(纯粹是巧合)。 有一个简单可靠的方法(cron脚本?),让我知道我的GlusterFS 3.2卷的健康状况?
有没有人有任何公式,或者从他们的环境,可以帮助我估计有多less磁盘空间将被每个数据点石墨使用一些示例数据?
所以我们在CentOS上运行Groundworks(用Nagios)来监视我们的各种服务器和进程。 我有它设置为自动发送电子邮件和短信文本时,达到警告或危急状态。 通常这是完美的。 但是,两次我们遇到了Postfix在Postfix决定停止发送邮件的问题。 最近的时间持续了4天,因为我们没有人注意到。 这导致我有一个重要的问题:我该如何监控我的监控服务器?
与monit相比,nagios是否提供任何附加function? 这个答案指出,monit是情境意识的一个笨拙的工具,这就是我提出这个问题的原因。
SMART (用于自我监测分析和报告技术)是一项非常棒的技术,可以在发生硬盘故障之前检测硬盘故障。 但SMART是否与SSD相关?
据我所知,这里是主要的区别: 与数据库大小预先确定的Graphite不同的是, OpenTSDB不会损坏数据。 OpenTSDB可以存储每秒的指标,而不是石墨有很小的间隔(我不确定这一点,石墨文档显示保留策略,每分钟存储指标,但我不知道这是否是我们的最小时间单位可以玩) 我想做出明智的决定,使用哪个工具来存储指标,我是否错过了这两个系统中的其他差异? 他们如何performance/可扩展? 奖金问题:我还有其他时间系列系统吗?
人们使用什么网站监控服务? 我指的是一个服务,我可以configuration特定的点击到我的网站来监视,如果该网站已经到位,以及它响应的速度有多快。 我正在寻找一个外部服务,这将打击我的服务器从几个地点,并会提供通知,如果该网站没有回应在一定的容忍度。 它可以是免费的或付费的。