ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Zabbix 6.0从零部署实战:服务器监控平台搭建与告警配置全指南

2026/9/13 14:44:17 拓冰建站 浏览量
Zabbix 6.0从零部署实战:服务器监控平台搭建与告警配置全指南 开篇先说个真实感受我前两年一直坚持用一堆自写脚本加crontab巡检服务器CPU、内存、磁盘、端口全拆成零散任务说难听点就是“脚踩西瓜皮滑到哪算哪”。直到服务器数量上了三四十台告警靠看日志、排查靠翻记录实在顶不住了才认认真真把Zabbix系统部署起来。这篇文章不端着讲就是我最近一次从零部署Zabbix 6.0 LTS到监控业务主机的完整记录从装包、初始化数据库、配置前端到添加第一台被监控主机、打通告警通道再到各种报错的排查思路全给你捋一遍。这套东西适合谁如果你是运维新人、兼职管服务器后端的人或者正在纠结要不要上正经监控平台这篇能让你少走至少一星期的弯路。看完跟着敲基本能复现一套能用的监控环境。注意我用的系统是CentOS 7.9RHEL系但Ubuntu/Debian的命令差别我尽量都标注出来。1. 为什么我把Zabbix当监控主力核心概念先说清1.1 Zabbix到底能监控什么、适合什么场景很多朋友会用Prometheus、Grafana、夜莺这类方案做监控各有各的好但Zabbix在我这边的环境里胜在“什么都收、开箱即用”。它不是一个只能做指标采集的时序系统而是把采集、存储、告警、可视化、权限全部整合在一个平台里。你可以监控服务器CPU、内存、磁盘、网络流量也可以监控交换机和路由器SNMP协议还可以监控Java应用JMX、数据库、自定义脚本返回的任意键值甚至能监控Docker容器资源占用、通过IPMI监控物理机硬件温度。实际项目里我覆盖了这几类Linux服务器Agent2方式、Windows服务器安装Windows Agent、几台Dell物理机的硬件状态IPMI、核心交换机的端口流量和错误包SNMP以及业务层的HTTP接口可用性。Zabbix在这方面很省事模板库自带大量现成监控模板选好模板后监控项、触发器、图形会自动生成。你需要的不是“怎么发明监控”而是“怎么把已有的模板正确关联到主机上”。它适合什么场景呢如果你管理的节点数量从几台到几千台跨度很大Zabbix都能撑住。小规模时单台Server加Agent就够了规模变大以后可以加Proxy做分布式采集再大了可以搞高可用。这种平滑扩容能力是我最终选它的主要原因之一。1.2 关键组件一次讲明白Server、Agent、Proxy、数据库想要不稀里糊涂地装完必须先把Zabbix里几个词搞明白。Zabbix Server是监控中心的大脑负责接收Agent上报的数据、执行数据计算、判断触发器状态、发送告警通知。前端Web界面和Server是分开的服务但通常装在同一台机器上浏览器访问的是前端前端再通过PHP服务去读数据库和Server交互。Zabbix Agent是安装在每台被监控主机上的轻量程序负责采集本机数据再交给Server。Zabbix有Agent1和Agent2两个版本Agent2是后来重写的新版本内置了更多插件化采集能力比如Docker、Redis、MongoDB这类都能直接用插件采我的建议是直接用Agent2别再用老Agent。Zabbix Proxy是给大规模架构用的中间层Proxy代替Server去采集远端主机数据采集完缓存在本地再统一回传给Server。跨机房、跨网络、节点特别多的时候非常管用能大幅减轻Server压力这就是为什么它在“其他主机怎么添加zabbix监控”这个问题里经常被提到。数据库不用多说了Zabbix所有配置、历史数据都落库。历史数据量很大所以数据库规划和定时清理策略要早点想清楚不然后期会吃满磁盘。2. 部署前的准备环境评估与组件选型2.1 服务器规格评估多少台设备配什么机器部署前先算算账。Zabbix官方给了大致的容量公式但实际经验更直观如果监控目标是几十台的量级一台2核4GB内存的云主机或虚拟机就足够跑ServerMySQL前端了几百台的量级建议4核8GB以上并且数据库要单独放或者使用高IOPS磁盘上千台就得考虑Proxy拆分采集压力数据库也建议换成Percona或PostgreSQL并做分区表。我这边的环境大约40多台服务器、几台网络设备单台4核8GB的CentOS虚拟机跑起来非常轻松。磁盘IO反而是更值得留意的点监控数据库是典型的高写入负载普通HDD到了每秒几百个指标插入时会有压力至少要上SSD。关于操作系统我推荐RHEL系CentOS 7/8/9、Rocky、AlmaLinux或者Ubuntu 20.04/22.04。Zabbix官方仓库对这几个系统的支持最好安装包也最全。别用太冷门的系统否则编译安装时的依赖问题会让人很崩溃。用什么系统其实不影响最终监控效果关键是别在部署环节较劲。2.2 数据库和Web服务器的选型思路Zabbix 6.0官方支持的数据库有MySQL、MariaDB、PostgreSQL三种都行。在小规模场景里MariaDB和MySQL差别不大我更推荐MariaDB原因很简单兼容性好CentOS自带软件源里就有少配一个第三方仓库。PostgreSQL我也用过如果你本来就熟悉PG而不是MySQL直接用PG完全没问题Zabbix对PG的支持同样完善。Web服务器方面Zabbix前端是PHP应用可以用Apache跑也可以用NginxPHP-FPM跑。CentOS默认仓库里Apache装起来最省事rpm包装完基本不用改什么。但如果你对这种组合比较熟还是建议用Nginx资源占用更低并发处理也更好。我在生产环境用了Nginx后面会写出具体配置。这里有一个我的习惯官方默认支持的组件组合是一个底线兼容方案功能没问题但性能未必最优。我建议不用“反正装完能跑就这样”的心态而是尽量选你日后能维护住的技术栈。监控系统是长期建设不是装完不管。2.3 三种安装方式对比编译、软件包、容器Zabbix的部署方式大概有三类源码编译安装、官方仓库软件包安装、Docker容器化部署。源码编译是最折腾的要自己解决PHP依赖、编译参数、模块加载除非你有定制化需求否则完全没必要。Docker方式现在很流行一条docker-compose就能拉起来整套环境做测试环境很爽但生产环境用容器跑监控你得额外考虑数据卷备份、容器更新、网络模式要能被Agent反向连接等问题并没有想象中那么省心。我最推荐的是官方软件包安装方式。Zabbix官方仓库提供完整的rpm/deb包和依赖一条命令装好Server、Agent、前端、数据库脚本安装路径和配置文件也完全符合Linux惯例。对于第一次部署、想快速产出成果的同学来说这是最稳妥、兼容性最好的路线。后面所有步骤都基于这种方式。3. 保姆级安装实测从零装好Zabbix 6.03.1 安装Zabbix软件源官方repo配置Zabbix默认不在系统官方源里必须先把Zabbix官方源配上。以CentOS 7为例命令是这样rpm -Uvh https://repo.zabbix.com/zabbix/6.0/rhel/7/x86_64/zabbix-release-6.0-4.el7.noarch.rpm yum clean all yum makecacheUbuntu系的话对应的操作是wget https://repo.zabbix.com/zabbix/6.0/ubuntu/pool/main/z/zabbix-release/zabbix-release_6.0-4ubuntu22.04_all.deb dpkg -i zabbix-release_6.0-4ubuntu22.04_all.deb apt update装完源以后确认一下repo文件是否生成成功直接看/etc/yum.repos.d/zabbix.repo是否存在即可。这一步如果跳过排查后面yum会提示找不到包。另外版本号要提前想好我建议选6.0 LTS长期支持版一直到2027年都有官方维护。别用最新的7.0虽然功能多但生态组件兼容性还要时间沉淀。然后一次性装齐核心组件yum install -y zabbix-server-mysql zabbix-web-mysql zabbix-agent2 zabbix-sql-scriptsUbuntu则用apt install zabbix-server-mysql zabbix-frontend-php zabbix-agent2 zabbix-sql-scriptsZabbix 6.0之后Ubuntu包把前端单独拆出来了记得要把前端也装上。提示zabbix-sql-scripts这个包非常关键里面包含了初始化数据库所需的server.sql.gz文件。我见过有人反复卡在“数据库导入失败”问题上最后发现是只装了server没装脚本包。3.2 初始化数据库建库、建账号、导入表结构Zabbix Server首次启动前必须有可用数据库。先启动MariaDB并设置为开机自启systemctl start mariadb systemctl enable mariadb mysql_secure_installation然后进入MySQL创建数据库和专用账号CREATE DATABASE zabbix CHARACTER SET utf8mb4 COLLATE utf8mb4_bin; CREATE USER zabbixlocalhost IDENTIFIED BY YourStrongPassword; GRANT ALL PRIVILEGES ON zabbix.* TO zabbixlocalhost; FLUSH PRIVILEGES;字符集这块很重要一定要用utf8mb4而不是默认的utf8否则后面模板里凡是有中文描述、中文告警消息、带Emoji字符内容的数据都可能乱码。我也强烈建议建库时把排序规则明确为utf8mb4_bin这样比较操作更精确。接下来导入Zabbix官方提供的表结构。Zabbix 6.0之后脚本路径统一放在/usr/share/zabbix-sql-scripts/mysql/server.sql.gz导入命令是zcat /usr/share/zabbix-sql-scripts/mysql/server.sql.gz | mysql --default-character-setutf8mb4 -uzabbix -pYourStrongPassword zabbix这个过程需要一点时间我导入时大概花了两三分钟。如果中途报错多半是账号权限不够或者字符集参数没带全。导入完成以后可以快速验证一下mysql -uzabbix -p -e use zabbix; show tables;能看到一百多张表就算成功。3.3 配置Zabbix Server并启动服务数据库就绪后编辑/etc/zabbix/zabbix_server.conf找到下面这几个参数并修改DBHostlocalhost DBNamezabbix DBUserzabbix DBPasswordYourStrongPassword有几个细节你要注意。DBHost如果填localhostZabbix会通过socket连接数据库如果填127.0.0.1则走TCP端口3306连接。两种都行但必须和MySQL里账号的host定义对应上——如果账号是zabbixlocalhost而配置里写127.0.0.1有可能会授权不匹配报Access denied。如果数据库和Server不在一台机器这里就填数据库服务器的IP同时创建账号时要改成zabbix10.0.0.%这样的网段授权。配置好以后启动服务systemctl restart zabbix-server systemctl enable zabbix-server再确认进程和端口systemctl status zabbix-server ss -lntp | grep 10051Zabbix Server默认监听10051/TCP这是Agent回连用的端口Web前端不需要额外端口直接由Nginx/Apache承载。如果10051端口没起来先看日志/var/log/zabbix/zabbix_server.log里面会明确写出缺了什么依赖或哪个配置项不对。3.4 配置前端环境并完成浏览器安装向导Zabbix 6.0前端需要PHP 7.4以上还需要几个PHP扩展。我用的是Nginx方案先安装PHP和依赖yum install -y php-fpm php-mysqlnd php-gd php-xml php-mbstring php-bcmath php-ldap php-json php-secgsettings然后在Nginx配置里加入Zabbix前端站点的location指向。官方rpm包在装zabbix-web-mysql时CentOS会自动生成Apache的虚拟主机配置所以如果你用Apache装完直接启动httpd就行默认监听80端口。如果和我一样用Nginx需要手动加这么一段server配置server { listen 80; server_name zabbix.example.com; root /usr/share/zabbix; index index.php; location / { try_files $uri $uri/ /index.php?$args; } location ~ \.php$ { fastcgi_pass unix:/run/php-fpm/www.sock; fastcgi_param SCRIPT_FILENAME $document_root$fastcgi_script_name; include fastcgi_params; } }注意PHP-FPM的socket路径因系统而异CentOS 7默认在/run/php-fpm/www.sock如果你用的是PHP 8.0 CentOS 8路径可能变成/run/php-fpm/www.sock版本不一样位置可能不同打开www.conf看一眼最保险。接着要改PHP的时区配置。编辑/etc/php-fpm.d/www.conf或者/etc/php.ini找到date.timezonephp_value[date.timezone] Asia/Shanghai这一步极容易被忽略。Zabbix前端检查页面会直接报Timezone: Timezone mismatch后果是前端会一直提示“Zabbix server is not running”或者所有图形的时间轴全乱后面我会在排查章节专门说这个坑。配置完成后启动PHP-FPM和Nginxsystemctl restart php-fpm nginx systemctl enable php-fpm nginx浏览器访问http://服务器IP/就能看到Zabbix安装向导。按照向导步骤第一步确认PHP环境检查全部OK第二步填写数据库连接信息主机、端口、库名、用户、密码第三步设置Zabbix Server主机名和端口默认即可第四步设置前端管理员密码。安装完成后自动跳转到登录页默认账号是Admin初始密码是zabbix。注意向导最后一步要求你设置Admin密码但如果你选了跳过默认账号Admin密码就是zabbix。登录后第一件事就是去“用户-用户”里改掉默认密码别问我为什么反复强调这个。3.5 安装Agent2并确认Server状态前端装完只是第一步没有Agent的Server等于空转。在需要被监控的机器上安装Agent2rpm -Uvh https://repo.zabbix.com/zabbix/6.0/rhel/7/x86_64/zabbix-release-6.0-4.el7.noarch.rpm yum install -y zabbix-agent2编辑/etc/zabbix/zabbix_agent2.conf重点配置三个参数Server10.0.0.10 ServerActive10.0.0.10 Hostnameweb-server-01Server被动模式下允许谁拉取数据和ServerActive主动模式下Agent主动上报到谁填你Zabbix Server的IP可以做网段比如10.0.0.0/24。Hostname一定要填写一个唯一标识并且后面在Web界面添加主机时主机名称必须和这个完全一致。很多人栽在这——Web里主机名填的是IPAgent配置里Hostname填的是主机名两边对不上图像里可能一直显示红色“不支持”。Windows机器也支持Agent2直接去官网下Windows agent2安装包装好后改同样的conf文件在服务列表里启动“Zabbix Agent2”服务即可。启动Agent2systemctl restart zabbix-agent2 systemctl enable zabbix-agent2回到前端在“监测-主机”页面可以看到Server本机已经被默认添加了状态可能是绿色的“已启用”。如果显示红色“不支持”先看Server端日志和Agent端日志用zabbix_get手动测试拉取zabbix_get -s 10.0.0.11 -p 10050 -k system.cpu.load能返回数值就说明链路通了。检查完别忘了打开Zabbix Server的防火墙放行端口firewall-cmd --permanent --add-port10050/tcp firewall-cmd --permanent --add-port10051/tcp firewall-cmd --reload4. 添加第一台被监控主机监控项、触发器、告警全流程4.1 手动添加主机并关联模板Zabbix的Web界面添加主机流程很清晰但有几个选项值得反复讲。进入“数据采集-主机-创建主机”需要配置的内容有主机名称填一个易识别的名字比如web-server-01这个名称必须和Agent配置里的Hostname一致。可见名称可以自由写中文不影响Agent匹配。模板选择对应系统的模板Linux主机选Linux by Zabbix agent active想采集更细就再关联一个Linux by Zabbix agent。主机组建议按业务线或者机房划分方便告警时看归属。SNMP接口/IPMI接口只有需要监控网络设备或物理硬件时才填。InterfacesAgent接口这里填被监控主机的IP地址端口默认10050。保存以后等待几十秒主机的可用性状态就会从灰色变成绿色。你可以在“监测-主机-最新数据”里筛选刚加的主机看到CPU、内存、磁盘等数据在跳。如果最新数据里全是“不支持”优先检查Agent进程、网络连通性、防火墙和Hostname匹配。模板是Zabbix最核心的资产它不是一个监控项而是监控项、触发器、图形、告警动作的集合体。选对模板等于把别人大半年的监控经验直接搬过来了。所以尽量别自己从零建监控项先在默认模板里翻一遍大概率有你需要的。4.2 主动模式和被动模式怎么选Zabbix Agent有两种数据采集模式理解这个对部署架构非常重要。被动模式是默认的Server主动连Agent的10050端口发起请求Agent返回数据。这种方式适合Agent和Server网络互通、且数量不太多的场景。主动模式下Agent会按照配置中的刷新间隔定时连接Server的10051端口拉取自己需要采集的任务清单然后采集完毕再主动把数据推送给ServerServer不需要主动建连到Agent。怎么选呢我的经验是如果被监控主机在内网并且数量不多全走被动模式最简单排查链路也直观。但如果主机分布在多个网段或者Agent在NAT后面、端口转发困难就用主动模式。跨机房场景我强烈建议走Proxy 主动模式采集压力不经过公网数据先落到Proxy再由Proxy统一回传。在Web界面添加主机时模板名里通常包含active字样比如Linux by Zabbix agent active就是主动模式模板Linux by Zabbix agent是被动模式。不要混着乱选我见过有人两块都选了导致监控项重复后期改配置时非常乱。4.3 配置触发器与邮件告警让系统主动找人监控光有数据没告警等于白搭。Zabbix的告警链路是“监控项-触发器-动作-媒介”。触发器是告警判断规则动作是当触发器状态改变时执行什么操作媒介是通知渠道邮件、脚本、Webhook。以最常见的“CPU使用率过高”为例官方模板里自带这样一个触发器min(/Linux by Zabbix agent active/system.cpu.util[,total,avg1],5m)90。意思是在最近5分钟里CPU使用率平均值超过90%就触发告警。新建触发器也很容易公式里可以引用多个监控项比如磁盘某个分区使用率大于90%同时剩余空间少于5GB才告警这样能显著减少误报。接下来配动作。进入“告警-动作-创建动作”选择触发器条件为“问题严重性警告”配置操作默认发送告警媒介给用户、每隔10分钟发送提醒、最多发送5次。通知内容里最好带上主机名、当前值、事件ID用模板变量{HOST.NAME}、{ITEM.NAME}、{ITEM.VALUE}、{EVENT.ID}拼一段清晰的消息。邮件通知是最大路货的方案但也最直接。在“用户-用户-选择用户-告警媒介”里添加Email填好SMTP服务器、端口、账号密码。Zabbix 6.0内置了邮箱认证选项不需要再写脚本。我实测的写法是SMTP服务器smtp.exmail.qq.com、端口465、连接安全选SSL/TLS、勾选“验证”填邮箱账号密码测试发送后一分钟内能收到。需要注意的是很多云服务商默认封了25端口用465的SSl加密端口更稳。如果你想通知到钉钉、企业微信或者飞书比邮件更及时。Zabbix 6.0以后支持Webhook告警媒介在“告警-媒介类型”里选择“Webhook”并填入企业机器人的Webhook地址消息内容通过JSON模板拼接字段保留字{ALERT.MESSAGE}就是你要发送的正文。这种方式不用写脚本配置门槛低了很多。当然也可以用自定义脚本放在AlertScriptsPath目录里调用curl去发HTTP请求这个方式更灵活适合对接内部自建系统。4.4 用Proxy扩展监控规模什么时候需要以及怎么加当你节点数量多了或者出现了跨网段、跨机房的监控需求时单台Server直接连Agent就开始吃紧。采集本身不重但Server和海量Agent保持长连接、频繁执行轮询任务CPU和文件句柄会涨得很快。这时候就该上Proxy了。Zabbix Proxy部署在离被监控主机最近的区域它自己充当一个迷你的Server负责采集、缓存、预判然后周期性把数据发给远端真正的Server。被监控Agent只需要能连上Proxy即可不需要直接通到总部的Server。安装Proxy很简单和装Server类似只是换一个包名yum install -y zabbix-proxy-mysql然后初始化一个独立的数据库Proxy有自己的库在zabbix_proxy.conf里填写对应的数据库连接以及Server参数指向总部的真实Server IP。Web界面的“数据采集-代理程序”里添加这个Proxy然后创建主机时把“由代理程序监测”选成这个Proxy主机就会自动改为由Proxy采集。我用Proxy最大的体验是跨机房的监控不再受主链路延迟影响不用在总部和机房之间开放大范围端口。Agent只要单向连到Proxy即可。缺点就是整体延迟上升了告警可能晚十几秒一般不影响使用。5. 踩坑实录部署和日常运维的常见问题5.1 “Zabbix server is not running”排查思路这个报错是部署期出现频率最高的一个几乎每个装Zabbix的人都会碰到。前端顶部一直显示黄条“Zabbix server is not running: the information displayed may not be current.”相信很多人在搜索栏里敲过这句话。先说结论这个黄条的意思是Web前端检测不到Server的内部状态信息不代表一定Server宕机。它有三个常见诱因。一是Server进程确实没起查systemctl status zabbix-server和日志。二是Server起来了但前端连数据库用的时区和服务器的时区不一致PHP参数date.timezone没设置前端认为Server状态是过期的。三是数据库鉴权或权限问题Server无法正常读配置。我用一个固定顺序排查先看进程存活然后看/var/log/zabbix/zabbix_server.log有没有错误再看PHP时区最后确认zabbix_server.conf里的数据库密码和实际一致。一般90%的情况集中在后两者尤其是时区问题最隐蔽。前端安装向导里虽然提示了date.timezone但一堆人跳过了。5.2 数据库连接报错Access denied for user replace_user部署Zabbix时数据库账号密码是操作最频繁但也最容易翻车的地方。常见的报错是日志里出现Access denied for user replace_userlocalhost (using password: YES)这个报错十有八九就是你zabbix_server.conf里的DBPassword字段没改或者改后没重启Server。Zabbix安装包里的配置文件默认模板数据库密码是replace_user或者空密码仅仅修改DBUser是不够的。我建议安装完以后第一时间用grep ^DB /etc/zabbix/zabbix_server.conf命令把整个数据库配置段拉出来核对一遍。另外一个容易忽略的点是MySQL8.0的默认认证插件是caching_sha2_password而Zabbix Server编译时的MySQL客户端版本如果较老可能无法识别这种认证方式。建议在创建用户时明确指定IDENTIFIED WITH mysql_native_password BY password或者统一把Zabbix库账号改成mysql_native_password认证能省去一堆兼容性麻烦。5.3 图形中文乱码问题字体导致监控运行一段时候后你会发现前端图形里的中文标签全是豆腐块或者乱码。这其实不是Zabbix的问题而是系统里没有中文字体或者Zabbix默认指定的DejaVu字体不支持中文。我的解决办法是上传一套中文字体到服务器比如从Windows复制simhei.ttf或者从CentOS安装wqy-microhei将字体文件放到/usr/share/zabbix/assets/fonts/然后修改Zabbix的graphfont配置指到新字体。在Zabbix 6.0里图形字体配置路径在/usr/share/zabbix/include/defines.inc.php中的ZBX_GRAPH_FONT_NAME常量把值改成字体文件名即可。改完以后要清一下浏览器缓存图形会立刻生效。别忽略这个小问题中文乱码虽不影响数据准确性但一旦给老板展示大屏界面很难看影响观感信任度。5.4 时间不一致告警误报、图表错位的元凶Zabbix整个系统非常依赖时间一致性。如果Server的系统和数据库主机、Agent主机的时间相差超过一两分钟会导致触发器判断错位、告警乱报、图形时间轴漂移。部署完成后我建议在所有机器上统一配置NTP时间同步。CentOS上配置yum install -y chrony systemctl enable --now chronyd timedatectl set-ntp true然后确认硬件时钟也同步hwclock --systohc。同时检查timedatectl status里的时区是否为Asia/Shanghai如果不是执行timedatectl set-timezone Asia/Shanghai。这一步做完很多看起来莫名其妙的监控异常会自然消失。5.5 一些我长期使用积攒下来的经验心得最后分享几条只有真正跑了一段时间监控后才会意识到的东西不算标准文档内容但很有用。第一Zabbix自带的模板是很好的学习材料。模板里的监控项名称、键值命名规律、触发器表达式设计得很成熟碰上奇怪的需求不知道怎么采集先去翻模板参考它怎么写比自己从零造轮子强太多。第二监控项的采集间隔不要太贪心。默认模板的间隔大多在1分钟到5分钟完全够用。想设置10秒、5秒的高频采集要评估一下数据库写入压力。我早期在某台机器上把关键指标全设成10秒采集后端MySQL慢查询暴增最后只能连夜调回默认值。第三告警一定要分层。开发环境可以用模板默认告警但生产环境的告警阈值一定要自己压测调整过。不要一上来把告警级别全设成“严重”否则三天以后你就会被告警疲劳淹没真正重要的告警反而被忽略。我习惯是先用一个月默认阈值跑出基线再根据历史数据去精调每个关键业务的触发器。第四别忘了给Zabbix本身做监控。很多人搭好平台就去监控业务机器了反而忘了Zabbix Server自身。最好在Server上也跑一个Agent接入自身监控再配上磁盘空间、内存使用、服务存活这几个触发器别让监控系统自己变成监控死角。这是我的真实教训有一回Zabbix Server所在磁盘写满了整个监控平台挂掉我是直到用户反馈才发现出问题。