我已经在一个实例上运行了API和服务器,并且在单独的实例上运行了RabbitMQ。 这对我们来说工作得很好。 但是,如果服务器或api与RabbitMQ的连接松动,则Sensu服务器不会发送任何通知。 我希望服务器在这种情况下No keep-alive sent from client in over 120 seconds通知No keep-alive sent from client in over 120 seconds发送No keep-alive sent from client in over 120 seconds 。 正如现在我们的设置,如果RabbitMQ失败(或连接失败),所有的监控将悄然失败。 当服务器或API进程松散连接到传输(RabbitMQ)时,如何将Sensuconfiguration为发送通知? 一般来说,监控监控软件的最佳做法是什么?
我用icingaweb2安装并configuration了Icinga2。 我添加了一个testing服务的testing主机:我们称之为“example.com”。 这是testing主机: /etc/icinga2/conf.d/hosts/example-com: object Host "example-com" { //Importiert die generische Host-Vorlage aus der template.conf import "generic-host" //IPv4 Adresse address = "2xx.2xx.2xx.2xx" //Angabe des Betriebssystemtyps vars.os = "Linux OS" vars.sla = "24×7" } 好的,那么我们有服务configuration: /etc/icinga2/conf.d/hosts/example-com/http.conf object Service "http" { import "generic-service" host_name = "example-com" check_command = "http" vars.sla = "24×7" } 当然,我在/etc/icinga2/conf.d/users.conf中添加了一个新的用户组 /** * The […]
我正在设置Nagios监控。 我能够设置和监视系统进程。 现在,我正在设置自定义运行进程的监视。 我们正在使用标识符运行python工作进程。 每个进程都有独立的pid文件(worker_1.pid,worker_2.pid) root 3642 1 3 Jan24 ? 08:22:36 /usr/bin/python /test/worker.py -i 1 root 345 1 3 Jan24 ? 08:22:36 /usr/bin/python /test/worker.py -i 2 我不知道哪个选项我必须使用check_procs分别监视这些进程? root@instance:/etc/nagios# /usr/lib/nagios/plugins/check_procs -C python -a worker PROCS OK: 2 processes with command name 'python', args 'worker' 谢谢
这是一个反复出现的问题,但是我能find的最接近的问题是7年前问的 ,而这个时间几乎是不同的。 我经营一个小型企业,我们主办了多个中小型客户端网站(没有任何需要超过几个1G数字海洋液滴)。 目前的解决scheme(ad-hoc脚本和电子邮件)开始显示其局限性,特别是当前的业务快速增长。 业务问题 因此,我需要build立一个新的解决scheme。 也许不是所有的一次,但我当然不希望重新做一切。 我能想到的要求: 简单。 简单。 简单。 我没有工作人员,我没有时间,我不消化胡说八道。 我准备好分配所需的资源,但不多。 没有SaaS。 在过去的几年中,我一直在使用大量的SaaS,他们最终都变得更加昂贵,停止服务或者购买,然后完全消失。 SaaS是我不想承担的风险。 最终,我只关心简单的事情: 我的网站没有错误,速度不够快? 我的网站是否超载? 我的磁盘是否满了? 有一个基于Ansible的自动部署系统,它应该能够负责为每个站点configuration监视/警报 我希望主pipe人员在凌晨4点以一切可能的方式醒来,当然如果有用的话 所有的事件/问题都应该在某个地方进行跟踪,并且易于移动(如JIRA板) 所有的数据应该存储在某个地方供我以后检查,包括HTTP日志,我希望能够在这些日志中查找缓慢或容易出错的页面。 我有几十个(Debian)服务器,需要集中所有关于它们的信息 我做了研究 为了做到这一点,我开始挖掘互联网,发现基本上可以互相连接的东西,如果你愿意的话。 ELK堆栈 (和“Beats”)。 似乎完美的收集和存储日志/指标。 您可以拥有漂亮的仪表板并查看您的数据,但这只是您所能做的。 X-Pack 。 似乎是与ELK完美的事情,但看起来像一个漂亮的废话蛋糕周围厚厚的糖衣。 另外,不公布价格的“订购”模式可能意味着价格过高。 Shinken / Nagios / Zabbix是最初的竞争者,但却很无聊而且复杂,需要自定义代码和全部的创可贴才能与ELK合作。 Riemann看起来像是一个很好的框架,可以触发警报,但不会在事后进行pipe理。 另外你必须自己写一切。 我不知道该把它插在什么地方(我不想有几个探针测量相同的东西)。 对我来说可能太复杂了。 ElastAlert可能是一个好主意,但似乎没有一个实际的方式来pipe理警报 bosun看起来比ElastAlert更成熟,更完整,但是也有相同的缺点和更复杂的configuration openduty环有趣,但显然太不成熟,被认为是可行的 cabot做出了很好的承诺,被一家公司用来制作和使用,这个公司为了编写文档,所以它可能不会死(虽然有点晕) 当然,还有普罗米修斯 , Graphana , Graylog , Fluentd和其他无数的人。 […]
我想在Windows上监视运行在JBoss Application Server(4.0版)中的Java Web应用程序的各种JMX属性和事件。 我需要将这些信息导入Microsoft Operations Manager(MOM),以便根据适当的标准提出警报。 从一个到另一个获取数据有什么select? 我唯一能想到的是JMX – > SNMP – > WMI – > MOM,但是这似乎比应该更复杂。 我接受所有的select,付费或免费。
我使用check_nt插件(通过check_nt_disk命令)监视Windows服务器上的磁盘空间使用情况。 这工作得很好,我也得到了一些不错的图表。 图(存储模板)的问题是x轴显示使用的磁盘空间而不是磁盘的总大小,例如: 产生这个数据的检查是有效的: ./check_nt -H 172.16.3.200 -p 12489 -s MyPassword -v USEDDISKSPACE -ld -w 80 -c 90 其中返回到nagios以下(我已经在pipe道字符上的两行分割): d:\ – 总计:19.55 Gb – 已用:3.65 Gb(19%) – 免费15.90 Gb(81%)| 'd:\使用空间'= 3.65Gb; 15.64; 17.59; 0.00; 19.55 我知道总可用磁盘空间正在被logging( 19.55 ),但是我不知道如何调整图表来使用这个作为y轴的比例。 有没有人做过这个? 我正在使用Nagios 3.2.3和Centreon 2.2 stable。 更新: 在回复regilero,这些都是我可用的曲线: 这些都是模板:
我们正在构build一个医学image processing软件栈,目前托pipe在各种AWS资源上。 作为这个应用程序的一部分,我们有一些长期运行的服务器(数据库,负载平衡器,Web应用程序等)。 在这些服务器上收集性能数据非常简单 – 我使用Nagios(用于监视/通知)和Munin(用于收集性能数据和显示趋势)的配方工作得很好。 但是,作为此应用程序的一部分,我们不断启动和终止EC2上的计算实例。 在典型用法中,这些计算实例启动,configuration自己,从消息队列接收作业,然后开始处理该作业,这需要15分钟到8小时以上的时间。 工作完成后,这些实例被终止,永远不会再被听到。 在这些短暂的实例中收集性能数据的体面战略是什么? 我不一定需要对他们进行监控 – 如果他们因为某种原因失败了,我们的应用程序会检测到这个情况,并处理另一个实例的重新启动工作,或者提升这个标志,这样pipe理员就可以看看事情了。 但是,收集CPU(用户,空闲,iowait等),内存使用情况,networkingstream量,磁盘读写数据等信息仍然是有用的。在我们的内部数据库中,我们跟踪机器的实例ID运行每个作业,查找特定实例ID的性能数据以进行故障排除和分析将非常有帮助。 Munin似乎不是一个好的候选人,因为它需要在文本文件中保留一个munin节点的列表 – 对于stream量大的环境来说,这并不理想,而且每个节点运行的时间很短,我宁愿保留全分辨率的数据,也不愿意随着时间的推移使RRD数据下降。 最后,我的猜测是,这将需要一个监控引擎: 使用数据库(MySQL,SQLite等)进行configuration和数据存储 公开了用于添加/删除主机和服务的API 评估选项时,我应该考虑其他事情吗? 但是,也许我正在过度思考这个问题,而且应该每隔1分钟在这些短暂的实例上运行sar ,并在终止之前收集sar db文件。
像许多人一样,我使用Zabbix系统来监视我的服务器。 如果我的一台服务器有问题,Zabbix会发送一条消息到我select的电子邮件地址。 (很多 – 大多数?监测系统是这样工作的。) 当一个警报发生时,我想让我的电话响起来,声音很大。 但我不想让它在收到的每封电子邮件或短信上发出一个响亮的声音。 是否有其他机制可用于将警报可靠地传送到移动设备,这些移动设备可以configuration一个响亮而恼人的提示音?
我有一个系统来testing一个软件套件的发布。 这个系统包括多个Red Hat 5服务器和Windows客户端在一个封闭的内部networking上。 我需要监视系统的每个方面的内存,networking和CPU使用情况。 目前我使用nmon来监视红帽服务器和内置的Windows性能监视器。 必须有一些比具有报告生成function的工具更好的工具。 社区使用哪些工具进行性能监控?
在过去的一年里,我一直在pipe理20-30个cPanel的主机,使用Puppet,Nagios和Munin进行一般的监视/趋势,但是我必须使用很多方法来部署/pipe理诸如configuration之类的东西。 对于那些不熟悉cPanel的人来说,它会为yum排除诸如perl *,ruby *等等。 这导致我能够通过Puppet(以及通过Packagetypes)在一个新的服务器上引导监视,这是由于与通过Yum安装的一堆冲突导致的问题。 现在我可以创build一个自定义的RPM的一切,并从规范文件中删除某些依赖关系,但我想避免这一点,如果可能的话。 有没有人有任何build议的function方式来pipe理这种环境? 目前我通过RPM安装Puppet,Facter和Munin,并使用–nodeps等方式强制安装(因为它们已经安装,只是没有Yum想要的)。 Nagios我现在从源手动安装(可能会创buildRPM的,但是我想先解决这个一般问题)。