我在EC2上的三个实例上安装了Graphite: 碳继电器 – relay1.graphite.prod.example.ec2 carbon-cache + webapp – cache3.graphite.prod.example.ec2 carbon-cache + webapp – cache4.graphite.prod.example.ec2 该继电器与一致哈希完美工作。 问题是两个Web服务器没有互相通信,所以我只能看到一个服务器的指标。 我花了很多时间在https://answers.launchpad.net/graphite/+question/114206 ,我无法弄清楚我设置不正确。 我可以从cache3对cache4运行wget,获取数据并在Apache日志中查看。 所以我不认为这是一个防火墙问题。 我试着在remote_storage.py中启用suppressError = False ,并在local_settings.py中打开了DEBUG,但是在Firebug中没有看到任何错误。 cache3 – local_settings.py CLUSTER_SERVERS = [ 'cache4.graphite.prod.example.ec2', 'localhost' ] cache4 – local_settings.py CLUSTER_SERVERS = [ 'cache3.graphite.prod.example.ec2', 'localhost' ] 我也尝试使用IP地址,并没有影响。 我做了一些更多的debugging和修改storage.py直接硬编码我的远程主机: STORE = Store(settings.DATA_DIRS, remote_hosts=["cache4.graphite.prod.example.ec2", "127.0.0.1"]) 这工作。 所以,不知何故,我的CLUSTER_SERVERS值不能从local_settings.py正确拉入。 有什么build议么?
我正在使用JMX从Apache Kafka收集指标,并通过collectd发送给Librato,一个可视化和监控服务。 问题是,一些指标似乎是错误的报告。 例如,没有任何人使用Kafka集群,一些节点报告大量的传入消息(如15,000),而其他节点报告0,如预期。 以下是collectd中的一个指标configuration: <MBean "kafka-all-messages"> ObjectName "kafka.server:type=BrokerTopicMetrics,name=MessagesInPerSec" InstancePrefix "all" <Value> InstancePrefix "kafka-messages-in" Type "counter" Table false Attribute "MeanRate" </Value> </MBean> 这里是Librato的图表: 有谁知道发生了什么问题? 它是我的collectionsconfiguration,如Type或类似的东西?
有没有人有托pipe服务的经验来监控电子邮件服务器的状态? 我在Linux VPS上托pipe自己的电子邮件。 如果我的SMTP或IMAP服务器停止响应请求,我想在10分钟内收到一条短信告诉我。 更好的是,我想能够设置任意的TCP横幅检查(即定期连接到指定的端口,并validation它收到一个指定的string)。 我知道有这样的软件 – monit,nagios等 – 但我不想自己托pipe或维护它。 订阅服务很好(实际上我希望为此付费)。 更新 :我以前说过, Pingdom只支持HTTP,但它实际上也支持SMTP和IMAP 。 感谢@fmu在Twitter上指出这一点!
我正在寻找一个SNMP温度监控解决scheme放入我的机架。 理想这个东西将是一个具有SNMPfunction的以太网设备。 我想把这些探头中的两个作为机架顶部和机架探头的底部。 无需花哨的无线网状networking解决scheme或任何东西。 任何build议?
我试图使用SNMP远程查看HP ProCurve 3500YL交换机的温度。 看这个MIB ,看起来如下的OID: hpCpuTemperature 1.3.6.1.4.1.11.2.3.7.11.17.7.1.1.1.6 hpPowerSupplyTemperature 1.3.6.1.4.1.11.2.3.7.11.17.7.1.1.1.7 hpChassisTemperature 1.3.6.1.4.1.11.2.3.7.11.17.7.1.1.1.8 在“hpProcurveSysMib”应该提供我需要的数据。 但是,每当我尝试访问这些OID时,我都会收到响应: SNMPv2-SMI::enterprises.11.2.3.7.11.17.7.1.1.1.6 = No Such Object available on this agent at this OID 进一步的调查显示,有问题的交换机似乎没有实现父级hpProcurveSystem MIB: SNMPv2-SMI::enterprises.11.2.3.7.11.17.7.1.1 = No Such Object available on this agent at this OID 有没有人知道由3500实现的替代MIB将允许自动轮询温度?
我想要一个高级testing,确保传入和传出的电子邮件服务正常运行。 我已经通过编写一个python脚本来达到这个目的: 通过我的邮件服务器发送带有唯一散列的邮件至[email protected] gmail帐户被configuration为自动回复到同一地址,然后删除该邮件。 我的脚本投票IMAP,直到它find一个电子邮件正确的哈希坐在其收件箱,或超时。 它报告了我的监控软件(Zabbix) 我的问题:gmail是最好的第三方使用? 我应该添加一些其他的,如hotmail和雅虎? 有没有更多的官员会自动答复这些“邮件坪”? 对于这种types的testing的任何其他build议?
我正在考虑一个策略来监视在http url托pipe的Web服务。 我希望能够知道它是否上涨或下跌。 我知道投票,但想知道是否还有其他不明显的策略。
我是Icinga2的新手。 我已经build立了几个服务检查。 现在我想检查一个TCP端口是否响应,如果它确实引发了一个down事件。 基本上我想扭转状态,因为通常这个端口不应该听。 我怎样才能做到这一点?
在Amazon EC2中,我有一个代理和一个监视器(MON)的设置。 我在代理和gmetad安装了gmond。 MON中gmetad.conf的数据源如下所示: data_source "proxies" proxy1:8654 proxy2:8654 proxy3:8654 在代理的gmond.conf中我有: tcp_accept_channel { port = 8654 } 一切工作正常,当我从MON到代理服务器时,我得到正确的数据的XML。 问题是Web前端只显示集群“代理”中的一个源,实际上它显示了我放在列表中的第一个源,在这种情况下是proxy1。 如果我改变顺序: data_source "proxies" proxy2:8654 proxy3:8654 proxy1:8654 它只显示来自proxy2的数据。 我在Ganglia使用TCP或UDP安装了其他监控系统,即使是通过ssh隧道,但我第一次看到这种行为。 我没有使用多播,因为(据我所知),亚马逊在他们的networking上不支持。 Ganglia-Web为什么只显示一个数据源?
是否有一个Solaris实用程序报告上述168小时(一周)内文件系统上的最小可用空间? 使用夜间df的问题是,可能会有日常的工作,这些工作在运行时几乎耗尽了磁盘空间,而是自行清理,所以在df运行时没有明显的问题。