Articles of 监测

如何更改Munin的图表颜色?

我开始使用Munin进行监控,但是我想改变graphics的颜色,这是由'loggrep'插件绘制的。 有什么办法来指定configuration文件中的颜色?

推荐的网站性能监控服务?

我正在寻找一个良好的网站性能监测服务。 我知道一些可用的常规监视服务,检查正常运行时间并通知您有关不可用的服务。 但我专门寻找一个重视性能的服务。 也就是说,我希望看到来自全球多个地点的详细效果统计信息的报告,并分析了获取不同网站资源所需的时间,其中包括第三方脚本,如Google Analytics(分析)等报告应该包含类似的细节,如FireBug Net标签)。 有没有这样的服务,如果是的话,哪一个最好?

监测工具,不平均的数据随着时间的推移

我正在寻找像Cacti这样的监控系统,它一次不会丢失数据,我发现所有的工具都使用rrd文件,这些文件随着时间的推移将数据平均化。 我希望能够回到(例如)4月1日中午12点,看看当时的数据是什么,而不是整天的平均水平。 有没有可以做到的监控系统?

Munin聚合图不起作用

我知道这个问题以前曾经在很多论坛上被问过几次,但是我仍然遇到类似的问题。 个别图表正常工作,但聚合图不是。 我什至没有一个空的图(没有数据的图)。 所有的机器都运行在Ubuntu-12.04 m1.medium ec2实例上。 Munin版本是1.4.6。 我的munin.conf看起来像… [的localhost.localdomain] 地址127.0.0.1 use_node_name是 [页面没有自动跳转-西1.compute.internal] 地址 use_node_name是 [页面没有自动跳转-西1.compute.internal] 地址 use_node_name是 [页面没有自动跳转-西1.compute.internal] 地址 use_node_name是 [美西1.compute.internal; totalcheckpoints] 更新编号 联系号码 postgres_checkpoints_checkpoints_req.update no postgres_checkpoints_checkpoints_req.graph yes postgres_checkpoints_checkpoints_req.graph_args –base 1000 -l 0 postgres_checkpoints_checkpoints_req.cdef 0 postgres_checkpoints_checkpoints_req.graph_category PG Total Checkpoints postgres_checkpoints_checkpoints_req.graph_title Aggregated checkpoints postgres_checkpoints_checkpoints_req.graph_vlabel Total Checkpoints postgres_checkpoints_checkpoints_req.checkpoints_req_total.label Total checkpoints postgres_checkpoints_checkpoints_req.graph_order checkpoints_req_total postgres_checkpoints_checkpoints_req.checkpoints_req_total.sum \ <internal_ip>.us-west-1.compute.internal:postgres_checkpoints_<internal_ip>.us-west-1.compute.internal_checkpoints_req.checkpoints_req \ <internal_ip>.us-west-1.compute.internal:postgres_checkpoints_<internal_ip>.us-west-1.compute.internal_checkpoints_req.checkpoints_req […]

“企业PKI”MMC是否允许对PKI进行任何自动化testing?

我正在使用企业PKIpipe理单元来诊断和检查MSFT PKI系统的运行状况。 有没有什么方法脚本/自动化这个工具来提醒我CRL的挂起到期或失踪的友邦?

运营团队的实时网站stream量监控

在中型网站上工作,我们一直build立自己的实时交通graphics解决scheme,并以大屏幕任务控制方式显示,以便在交通开始攀升,负载开始攀升,延迟增加等情况下,我们可以开始观看在监测系统closures之前主动进行。 现在我开始了一个新的公司,我们需要同样的东西,有公司有任务控制风格的实时网站监控软件产品? 不是网页分析,而是实时绘制诸如同时用户,页面浏览量,点击率,平均HTML呈现时间等等。这将需要在每个networking服务器(或负载平衡器)上安装某种代理,因为Javascript跟踪是不够的以检测例如何时垃圾邮件机器人开始打击网站。 我GOOGLE了,找不到任何东西。

Nagios中某些分组服务失败时通知

我有三个DNS服务,每个都在Nagios中configuration的不同主机上。 每个服务在发生故障时都会通知我(主机A上的DNSclosures)。 是否有可能configurationNagios,以便当所有三个DNS服务都通过寻呼机(DNS不工作)closures时收到一个(定制的)通知,并且只有一个服务出现故障时才会收到一个邮件(主机A上的DNS down )。 我看到如何实现这样的事情的唯一方法是使用服务依赖关系,这是很麻烦的。 他们也没有自己的通知。 你会怎么做?

将Nagiosconfiguration为警报,具体取决于服务警报源自的主机组

所以我的设置: 服务在所有主机(CPU / RAM /磁盘/服务)之间共享。 主机分为两大类:“生产”和“发展”。 我们有两个联络小组:“生产”和“发展”。 比方说,我的开发SQL服务器在RAM上运行低,我希望它只提醒那些在“开发”联系人组(这项服务当然分配给“开发”主机组中的一个主机,使用共享RAM监视服务)。 我几乎被困在这个…我不能在服务级别configuration它(他们在那里共享),我似乎无法得到升级来为我做… 我是否需要使用服务组以及升级并咬紧牙关build立该列表? 还是我错过了一些愚蠢简单的东西? 如果有帮助,我正在使用Centreon进行configuration。

如何根据SNMP中的原始CPU滴答来计算CPU百分比

根据http://net-snmp.sourceforge.net/docs/mibs/ucdavis.html#scalar_notcurrent ssCpuUser , ssCpuSystem , ssCpuIdle等不赞成使用原始变体( ssCpuRawUser等)。 前者的值(不包括nice,wait,kernel,interrupt等等)返回一个百分比值: 在最后一分钟计算的用于处理用户级代码的CPU时间百分比。 此对象已被弃用,以支持' ssCpuRawUser(50) ',可用于计算相同的指标,但超过任何所需的时间段。 原始值返回CPU花费的“原始”滴答数量: 处理用户级代码花费的时间(通常为1 / 100s)。 在多处理器系统中,' ssCpuRaw* '计数器在所有CPU上累计,所以它们的总和通常是N * 100(对于N个处理器)。 我的问题是:你如何把蜱的数量变成百分比? 也就是说,你怎么知道每秒钟有多less个嘀嗒声( 通常是 – 这意味着不总是 – 1 / 100s,这意味着每100秒钟1次,或者嘀嗒声代表1/100秒钟)。 我想你也需要知道有多less个CPU, 或者你需要获取所有CPU值来将它们加在一起。 我似乎无法find一个MIB给你一个CPU的整数值,这使得以前的路线尴尬。 后者的路线似乎不可靠,因为有些数字有时会重叠。 例如, ssCpuRawWait有以下警告: 此对象不会在底层操作系统不测量此特定CPU度量标准的主机上实施。 这个时间也可以包含在' ssCpuRawSystem(52) '计数器中。 一些帮助,将不胜感激。 到处似乎只是说%已被弃用,因为它可以派生,但我没有find任何地方,显示官方标准的方式来执行此推导。 第二部分是这些“蜱”似乎是累积的,而不是一段时间。 如何在一段时间内采样值? 我想要的最终信息是:“用户,系统,闲置,漂亮(理想情况下,窃取,尽pipe目前似乎没有标准的MIB)”的百分比(在过去的1-60s可能就足够了,偏好较小的时间跨度)。

没有多播的Ganglia

我在没有组播的networking上运行Ganglia 3.1.2(也不能打开它)。 有没有人有让神经正常工作的优雅的解决scheme? 我find了这个: http://code.google.com/p/ganglia-multicast-hack/ 但它不能很好地扩展。 现在,我在我的gmetad.conf文件中为networking中的每台主机分别设置了data_source行,但是这样也不能很好地进行扩展,并且我无法获得准确的汇总统计信息,因为它会一直覆盖rrds(尽pipe主机统计信息工作得很好)。 任何指针将不胜感激(或确认,我已经find了最好的解决scheme)。 谢谢!