netdata
提供秒级指标、异常检测与故障排查的实时基础设施监控
netdata 的特点是秒级采集加自动发现:装上去就能看到 CPU、磁盘、网络、容器和常见服务的图表,不用先写一堆采集配置和看板。排查刚才那一下卡顿这类瞬时问题时,它的时间分辨率明显优于分钟级采集的方案。代价是资源占用和数据量。默认高频采集在低配机器上有可感知的开销,长期留存需要配置分层存储或对接外部时序库。开箱指标又多又杂,告警必须自己收敛,否则噪音很快淹没真问题。它偏向看现在,做跨月容量分析和自定义查询不如 Prometheus 加 Grafana 那套灵活,不少团队是两者并存。开源版自托管免费,云端聚合、长期留存与团队协作按节点或席位计费,以官网当前页面为准。云端聚合会把指标发往外部,数据不出网的环境要先评估这一点。自托管服务尤其值得配上这一层。
- 价格模式
- 开源
- 中文支持
- 以英文为主
- 支持平台
- Web
适用场景
- 服务器出现短暂卡顿或抖动,用秒级图表回看那一刻究竟是磁盘、网络还是某个进程
- 新装机器或新上线服务后,快速拿到一套可用的基础指标视图而不写 exporter
- 容器与常见中间件的运行状态巡检,自动发现省掉逐个配置采集的工作
主要特点
- 秒级采集,排查瞬时抖动时分辨率优于分钟级方案
- 自动发现主机、容器与常见服务,装上即有图表,不必先写采集配置
- 指标带上下文的排障视图,便于从异常点顺着关联指标往下查
- 开源可自托管,指标可以完全留在自己的基础设施内
使用限制
- 默认高频采集在低配机器上有可感知的 CPU 与内存开销,需要调整采集粒度
- 长期数据留存要额外配置分层存储或对接外部时序库,默认不适合做跨月趋势分析
- 开箱指标数量庞大,默认告警不收敛,噪音容易淹没真正的问题
- 自定义看板与查询灵活度不如 Prometheus 加 Grafana 那套组合
- 云端聚合涉及把指标发往外部服务,对数据不出网的环境需要评估