macmon 通过 HTTP 暴露 Apple Silicon 性能指标,接入 Prometheus 与 Grafana 实现可视化监控。
macmon 负责免 sudo 采集 CPU/GPU/温度/内存指标,/metrics 端点以 Prometheus 文本格式输出,Grafana 负责可视化。
用 Docker 部署 GPUStack 集群管理器,编排 vLLM 等推理引擎提供 OpenAI 兼容模型服务。
GPUStack 负责调度与运维,自动配置推理引擎执行推理,Grafana/Prometheus 提供监控仪表板,Docker 承载部署。
组合多数据源、面板插件与模板变量构建可复用监控看板
数据源可按查询指定,面板插件扩展指标和日志的展示方式,模板变量支持动态复用。
为关键指标建立可视化告警并推送到协作与值班系统
Grafana负责定义并持续评估告警规则,Slack等系统负责接收通知。
以 VictoriaMetrics 作为 Prometheus 长期存储并在 Grafana 中替代查询
Prometheus 采集数据,VictoriaMetrics 提供可扩展长期存储与全局查询视图,Grafana 直接查询展示