Articles of 监测

Icinga2:如何在wave中做通知?

我目前正在build造我的Icinga2在一个新的结构,并希望添加一些function。 我完成了90%,但我错过了一个特点:通知我一波。 让我解释: 每当发生错误,我想要以下情况: 即时:发送邮件 5分钟后:发送聊天通知 10分钟:发送短信 30分钟:打电话给我 在第40分钟从发送邮件重复 现在一切都发生在同一时间,所以我有NotificationCommands和Notifications,但我不知道如何设置顶部configuration。 有人能帮助我吗? 祝你今天愉快, 巴斯蒂安

Exchange 2010中的“监视和状态”等同

Exchange 2003内置了一些非常基本的监视function。如果一个队列卡住了,它可能会向您发送一封电子邮件,通知您这个问题。 您还可以监视服务器的其他几个方面。 这对我的组织来说非常方便 – 几乎是所有我们需要的监控。 我们升级到了Exchange 2010,这个function似乎已经消失了。 有什么隐藏的等价物吗? Google无法帮助我,也没有手动/在线文档。 最后,我想实施一个更全面的监控系统 – 我一直在吃Nagios – 但是立即让基础知识重新开始运行会很好。

有人知道吗?

如何将侦察程序安装到Debian上?

自由形态监测工具

你能提出一些自由forms的监测工具吗? 我一直在尝试Graphite ,它允许你添加你喜欢的任何指标,并在现场绘制它们。 你不必定义一个新的主机,服务,无论如何。 如果你想要的只是绘制一些东西,你可以发送数据,你可以马上绘制图表。 我正在寻找更复杂的。 我正在寻找的function: 设置警报阈值 向度量标准添加更多元数据(应用程序,主机,单元…) 有一个networking前端来操纵所有这些东西 规则可以根据度量的名称自动添加元数据。 似乎除了Graphite之外,大多数系统都需要大量前期工作来添加指标,而我正在寻求避免这种情况。 如果我认为一个指标值得保留,我会在稍后分类。 谢谢

为什么我的munin插件被双重执行(同时)?

我有一个定制的munin插件,目前每次执行两次 $ ps fax 16844 ? Ss 0:00 /usr/sbin/munin-node 18206 ? S 0:00 \_ /usr/sbin/munin-node 18863 ? Ss 0:00 | \_ /bin/bash /etc/munin/plugins/fetch_partner 18910 ? S 0:00 | \_ wget -q -O /tmp/partner_debug_page.txt –keep-session-cookies –save-cookies /tmp/partne 18209 ? S 0:00 \_ /usr/sbin/munin-node 18892 ? Ss 0:00 \_ /bin/bash /etc/munin/plugins/fetch_partner 18917 ? S 0:00 \_ wget […]

如何设置大量的Cacti设备和graphics?

我有很多我想用Cacti监控的虚拟机。 有脚本可以轻松创build约100个条目吗? 我厌倦了为每个虚拟机反复重复同样的鼠标点击操作。

仅对某些数据源过滤Zenoss警报规则(或某些数据源仅在给定时间处于活动状态)

我们正在努力通过SNMP监视一些Zenoss服务,并实现了SNMP部分。 我们已经configuration了数据源(对于各种OID)以及这些值和要监视的主机的阈值。 对于警报规则,某些数据源应该在一定的时间间隔内被忽略/禁用。 我们目前的想法是:针对具有一定时间表的数据源X提供警报规则,并且针对数据源Y(具有不同的时间表)具有另一个警报规则。 检查事件,数据源名称似乎只包含在事件字段中 eventKey(eventKey是“data_source_name | data_source_name”) 重复数据删除(不包括在“警报规则”filter规则选项中) 问题:eventing包含在Alerting Rulefilter选项中,所以可以使用它进行过滤,还是有更合理的select? 或者,是否可以使用性能模板名称进行过滤? (我至less在过滤选项中找不到它) 另外,我的接近声音一般是否合理,还是有办法限制某些数据源/阈值仅在某些时间点处于活动状态? br,Touko

在Linux服务器上debuggingI / O问题

有什么方法来debuggingLinux服务器上的I / O问题? 我一直在使用: # nohup top -b -d 10 > /var/log/top.log & # nohup iotop -b -d 5 -o -t > /var/log/iotop.log & PS:硬件是干净的,新的和罚款。 SWAP没有被使用,我看到很多: [jbd2/sda6-8] [jbd2/sda2-8] [loop0] [loop1] [events/0] [flush-8:0] [kondemand/3] [ksoftirqd/3] [kblockd/2] 服务器在大部分时间都可以正常工作,然后随机调高到6.00〜38.00 Load Average。 我所有的箱子上都是PHP / Apache / nginx。 例: top – 03:25:11 up 1 day, 5:00, 3 users, load average: […]

执行时,服务是好的monit

我需要运行一个shell脚本,如果一个服务可以与monit,链接到我的其他监控系统(nagios)。 基本上我需要实现的是在服务重启时发出警报,当服务正常时发出另一个警报。 我已经尝试了以下没有任何运气: if 1 restarts within 1 cycles then exec "<send WARNING alert here>" if 0 restarts within 5 cycles then exec "<send OK alert here>" 以上抱怨“错误:在行动比率陈述中不允许使用零或负值”“确定”“ if 1 restarts within 1 cycles then exec "<send WARNING alert here>" else if succeeded for 5 cycles then exec "<send OK alert here>" 上面抱怨的“其他”…我相信“如果X重新启动”不支持“其他” 任何build议来实现这一目标?

Zenoss监控模板,清理事件

我在Zenoss上设置了一个监控模板来运行数据库查询,并使用Nagios检查查询的输出是否在可接受的范围内。 如果不是,则会生成CRITICAL级别的事件。 我的问题是:如果查询的输出在可接受的范围内,我怎么能使这个监视模板也产生一个CLEAR级别的事件。 通过这样做,一旦设备再次正常运行,任何以前生成的CRITICAL级别事件将自动closures。