进阶 dagster.io 2026-10-10 01:48:56 · 6 阅读

第24章 闭环 DataOps:我们为何为 Dagster+ 打造 Compass

第24章:闭环 DataOps:我们为何为 Dagster+ 打造 Compass

检测已不再是瓶颈,理解才是。Compass 通过将 Dagster+ 的运营数据转化为对话,从而闭合了这一循环。数据团队对管道拥有前所未有的可见性。现代的编排与可观测性工具捕获每次运行、追踪每个资产,并在故障发生时发出警报。曾经的承诺是,这些监控手段最终会让数据平台变得清晰透明,不再是不透明的黑盒。

我们一直在构建 Dagster,以解决数据工程中的“巨大复杂性”问题。但随着平台变得愈发复杂,我们为解决上一波复杂性而构建的抽象层,需要更多支持来处理下一波挑战。

一款优秀的可观测性与运营工具必须回答的核心问题是:“到底发生了什么?”而卓越的版本还能回答:“我接下来该做什么?”

Compass 正是为了弥合这一差距而生。

申请访问 Dagster+ Compass。

缺失的循环第三环

在运营分析领域,存在一个称为“闭环分析”的概念:这是一个捕获信号、分析模式、采取行动并衡量结果的循环。只有当每个阶段都能顺畅流入下一阶段时,该循环才能有效运作。

我们将 DataOps 视为同样的循环,它包含三个部分:编排 → 观察 → 行动。

Dagster+ 负责编排。你定义资产,设置调度和传感器,Dagster 确保管道在正确的时间以正确的方式运行。

Dagster+ 也负责观察。每次运行都被追踪,每个资产都有血缘关系。你可以看到哪些成功、哪些失败、哪些已过期,以及它们之间的依赖关系。元数据丰富且完整。

但第三部分——基于观察采取行动——传统上留给读者自行发挥。你拥有信号,现在需要自己弄清楚它们意味着什么,决定哪些重要,并确定下一步做什么。

可观测性行业一直在关注平均检测时间(MTTD)并取得了实质性进展。但检测不等于解决。团队在平均解决时间(MTTR)上仍举步维艰,因为将警报转化为理解需要人工调查:打开正确的视图、过滤到正确的时间窗口、跨作业交叉引用,并在脑海中进行模式匹配。

Compass 闭合了这一循环。它将 Dagster+ 的运营数据转化为对话,让你无需离开 Slack 即可从“好像哪里不对劲”过渡到“这是发生了什么以及下一步该做什么”。

Dagster+ Compass 集成的实际功能

Compass 是一个现在能够理解你 Dagster+ 环境的 AI 智能体。你可以用自然语言向它提问,它会基于你实际的运行、资产和元数据给出回答。

Compass 旨在引导调查,而不仅仅是回答一次性问题。它会建议下一步深入探索的方向,揭示你可能未曾想到要寻找的模式,并提供指向 Dagster+ 中具体行动位置的链接。

典型的调查可能从宏观开始:“给我总结一下我数据平台的健康状况。” Compass 会对常见作业的成功与失败运行进行拆解,按代码位置显示成功率,并列出过去七天的表现最佳和最差的对象。

随后,你可以顺着任何线索深入。查看失败时间分布,Compass 会展示按天和小时划分的速率,并突出显示值得调查的峰值。询问特定日期的失败情况,它会找出罪魁祸首,可能是一个反复失败的作业,外加几个零散的故障。

在每一步中,Compass 都会建议下一步操作:跨天对比、检查依赖关系、深入具体运行。对话层层递进,引导你找到根本原因,而不是让你自己去摸索下一步该点哪里。

我们自己的数据团队一直在使用 Compass 在更深层面上监控 Dagster 平台。我们的数据工程师之一 Nick Roach 对此评价道:“调查问题出现时,我希望有一站式体验。能够通过对话互动——并且让它建议下一步去哪里——这真的很令人兴奋。”

从救火转向基于模式的改进

Compass 的显而易见用例是事故分诊。某处出了问题,你问 Compass 发生了什么,你能比原来更快地得到答案。仅这一点就能减少解决时间。

但更有趣的用例发生在你不在“救火”的时候。

运营分析中最难的问题之一,是 Monte Carlo 所说的“未知未知”——那些因为你不知道去测试而不会触发警报的问题。即使你有覆盖预期故障模式的全面监控,仍可能错过缓慢的性能下降、逐渐增加的运行时间,以及那些故障频率足以让人烦恼、却不足以成为优先事项的不稳定作业。

由于 Compass 能够分析随时间变化的模式,它成为了浮现这些“未知未知”的工具。哪些作业最不稳定?哪些传感器运行时间比平时长?你在哪里浪费了重试次数?那些从未上升到事故级别、却在悄然侵蚀可靠性的失败长尾分布是什么样的?

这些问题团队通常没时间调查,因为总有更紧急的事情。但它们恰恰是随时间累积的问题。修复最不稳定的作业,就能消除一类噪音。识别出那个缓慢恶化的传感器,你就能在事故发生前捕获它。

Compass 让这些调查变得足够轻量,让你真正能够执行。问个问题,得到答案,顺着线索走。无需构建仪表盘或编写查询,只需进行一场对话。

为什么选择 Slack?

行业共识正在形成:数据必须嵌入到组织每天使用的应用程序中。需要频繁切换上下文才能使用的分析工具,在忙碌时往往被忽视,而那恰恰是最需要它们的时候。

我们首先为 Slack 构建 Compass(Microsoft Teams 和 Discord 即将支持),因为那里是数据团队进行协调的地方。当某处出错时,第一个问题通常是在 Slack 中提出的。分诊发生在 Slack,“有人能看看这个吗”的呼叫也在 Slack。

通过将运营智能嵌入团队已在工作之处,Compass 降低了从发现问题到理解问题之间的摩擦。你无需切换上下文去使用另一个工具,无需记得哪个仪表盘有你需要的视图。你只需要提问。

这也使协作变得无缝。当你从 Compass 获得答案时,可以直接在频道中分享。你的同事看到与你相同的上下文。调查过程变成了一个共享工件,而不是锁在某一个人的浏览器标签页中。

下一步

这次发布是更大愿景的基础。

数据平台的可见性一直是碎片化的。编排工具展示运行和调度,可观测性工具监控数据质量,BI 工具呈现数据内容。理解全貌意味着要将多个工具和心智模型拼接在一起。

Compass 改变了这一点。因为它基于 Dagster+ 构建,所以拥有完整上下文:哪些作业运行过,它们生成了哪些资产,依赖于哪些依赖项,以及它们如何相互关联。随着时间推移,我们将扩展至包含数据本身,让你能从“这个作业失败了”过渡到“输出中发生了什么变化”,再到“这是下游影响”。

我们还计划扩展至更多智能体工作流:创建工单、建议代码变更,最终辅助管道编写。但这取决于信任,这就是为什么我们从基于 Dagster+ 现实的对话界面开始。

可观测性工具解决了检测问题。Compass 通过解决理解问题来闭合循环。

查看实际演示:加入我们举办的“运行 Dagster:我们如何使用 Compass 进行 AI 分析”活动,看看我们的团队如何在自己的平台上使用 Compass。

如果你是现有的 Dagster+ 客户并希望通过 Compass 访问 Dagster+ 数据,请在此处申请权限。 有反馈或疑问?请在 Slack 或 Github 发起讨论。 感兴趣与我们共事?查看我们的开放职位。 想要更多此类内容?在 LinkedIn 上关注我们。

评论 (0)