应用介绍
搭一套监控通常是这样的:装 Prometheus,配 exporter,写 scrape 规则,再装 Grafana,找个别人做好的看板导进来,发现指标名对不上再一个个改。等你终于看到第一张图,一个下午过去了,而线上那台机器的问题早就过去了。
Netdata 反过来:装完就有图,不用写一行配置。它自己去发现机器上跑着什么——CPU、内存、磁盘、网卡、容器、数据库、nginx,八百多个集成挨个自动认,然后按每秒一次的分辨率采集,浏览器打开
告警这块它不让你先去猜阈值。每个指标在本机训练多个机器学习模型,学的是这个指标自己近期的行为基线,然后无监督地判断当前值算不算异常。仪表盘里有专门的 Anomaly Advisor 页面,把异常率画成一条曲线,圈一段时间就能看这段里哪些指标不正常。模型训练和推理都在被监控的机器上完成,指标不需要送到任何中心。
资源占用官方给的数是默认配置下约 5% CPU、150 MiB 内存;关掉 ML 和告警、用内存存储时不到 1% CPU、约 100 MiB。存储方面每个采样点约 0.5 字节,分秒/分钟/小时三层,缩放时自动选层,脏数据每 17 分钟才落一次盘。阿姆斯特丹大学 2023 年那篇 ICSOC 论文测下来,它是 Docker 环境里最省电的监控工具。
零配置自动发现:800+ 集成,系统、容器、虚拟机、硬件传感器、日志、OpenMetrics 和 StatsD 自动认,大部分东西装完就有图。
每秒粒度:采集和展示都是一秒一次,图表延迟一秒,不是那种一分钟一个点的折线。
边缘 ML 异常检测:每个指标在本机训练多个模型,基于历史行为做无监督异常判断,配 Anomaly Advisor 做根因分析和影响面判断,不用你设阈值。
分层存储:约 0.5 字节一个采样点,Tier 0 每秒、Tier 1 每分钟、Tier 2 每小时,查询时按缩放级别自动选,磁盘有多大就能存多久。
不用写查询语言:NIDL 数据模型自动生成看板,直接在图上按维度、节点、实例切片下钻,不需要 PromQL。
日志也接了:Linux 直连 systemd-journald,Windows 接 Event Log 和 ETW,在边缘处理后可视化;Linux 上还能看每个进程的 TCP/UDP 实时连接。
横向扩展:Parent-Child 结构把多台机器的指标集中到 Parent 上,做长周期留存和统一看板,Parent 在合适硬件上能吃到每秒百万级采样。
告警和通知:几百条预置告警规则,支持邮件、Slack、Telegram、PagerDuty、Discord、Teams 等渠道。
能导出到别处:指标可以导到 Prometheus、InfluxDB、OpenTSDB、Graphite,也提供 API 给第三方看板查。
平台覆盖:Linux、FreeBSD、macOS、Windows,另有 Docker 和 Kubernetes 部署方式;Linux 上还能盯 GPU、PCI AER、EDAC、IPMI、S.M.A.R.T、NVMe、风扇和电源电压这些硬件层面的错误。
许可要分开看:Agent 是 GPL-3.0+,也是这个仓库的主体;但 Netdata UI 走的是自家的 NCUL1 许可,不是开源协议,Netdata Cloud 是可选的商业服务。数据默认留在你自己的机器上,不接 Cloud 也能用。
Netdata 反过来:装完就有图,不用写一行配置。它自己去发现机器上跑着什么——CPU、内存、磁盘、网卡、容器、数据库、nginx,八百多个集成挨个自动认,然后按每秒一次的分辨率采集,浏览器打开
http://localhost:19999 就是完整看板,从数据到图的延迟是一秒。告警这块它不让你先去猜阈值。每个指标在本机训练多个机器学习模型,学的是这个指标自己近期的行为基线,然后无监督地判断当前值算不算异常。仪表盘里有专门的 Anomaly Advisor 页面,把异常率画成一条曲线,圈一段时间就能看这段里哪些指标不正常。模型训练和推理都在被监控的机器上完成,指标不需要送到任何中心。
资源占用官方给的数是默认配置下约 5% CPU、150 MiB 内存;关掉 ML 和告警、用内存存储时不到 1% CPU、约 100 MiB。存储方面每个采样点约 0.5 字节,分秒/分钟/小时三层,缩放时自动选层,脏数据每 17 分钟才落一次盘。阿姆斯特丹大学 2023 年那篇 ICSOC 论文测下来,它是 Docker 环境里最省电的监控工具。
软件功能
零配置自动发现:800+ 集成,系统、容器、虚拟机、硬件传感器、日志、OpenMetrics 和 StatsD 自动认,大部分东西装完就有图。
每秒粒度:采集和展示都是一秒一次,图表延迟一秒,不是那种一分钟一个点的折线。
边缘 ML 异常检测:每个指标在本机训练多个模型,基于历史行为做无监督异常判断,配 Anomaly Advisor 做根因分析和影响面判断,不用你设阈值。
分层存储:约 0.5 字节一个采样点,Tier 0 每秒、Tier 1 每分钟、Tier 2 每小时,查询时按缩放级别自动选,磁盘有多大就能存多久。
不用写查询语言:NIDL 数据模型自动生成看板,直接在图上按维度、节点、实例切片下钻,不需要 PromQL。
日志也接了:Linux 直连 systemd-journald,Windows 接 Event Log 和 ETW,在边缘处理后可视化;Linux 上还能看每个进程的 TCP/UDP 实时连接。
横向扩展:Parent-Child 结构把多台机器的指标集中到 Parent 上,做长周期留存和统一看板,Parent 在合适硬件上能吃到每秒百万级采样。
告警和通知:几百条预置告警规则,支持邮件、Slack、Telegram、PagerDuty、Discord、Teams 等渠道。
能导出到别处:指标可以导到 Prometheus、InfluxDB、OpenTSDB、Graphite,也提供 API 给第三方看板查。
平台覆盖:Linux、FreeBSD、macOS、Windows,另有 Docker 和 Kubernetes 部署方式;Linux 上还能盯 GPU、PCI AER、EDAC、IPMI、S.M.A.R.T、NVMe、风扇和电源电压这些硬件层面的错误。
许可要分开看:Agent 是 GPL-3.0+,也是这个仓库的主体;但 Netdata UI 走的是自家的 NCUL1 许可,不是开源协议,Netdata Cloud 是可选的商业服务。数据默认留在你自己的机器上,不接 Cloud 也能用。


