进阶 dagster.io 2026-10-10 01:48:56 · 6 阅读

第6章 AI工程师必备:数据工程的5条核心实践

AI 工程本质上就是数据工程。前者要想成功,必须借鉴后者的 5 条最佳实践。随着人工智能(AI)的迅猛发展和影响力不断扩大,AI 工程给人一种独立于数据工程之外的新学科的感觉,这不难理解。

但从本质上讲,AI 仍然建立在数据工程多年来一直遵循的相同基本原则之上。AI 系统,尤其是机器学习模型,其好坏完全取决于它们所消费的数据,以及支撑这些数据的基础设施。

要做到可扩展、可靠且高性能,AI 工程师必须采纳数据工程的最佳实践。

在本文中,我将介绍数据工程师们踩过坑才总结出的五条经验,并说明它们为什么同样适用于 AI 工程。

理解 AI 工程与数据工程

在深入最佳实践之前,有必要先弄清楚 AI 工程和数据工程分别是什么,以及它们的目标是什么。

什么是 AI 工程?

AI 工程是指开发 AI 工具和系统,使它们能够在真实世界中落地使用。这类实际应用包括:

为各种应用开发算法 为聊天机器人、语言翻译和文本分析开发自然语言处理模型 预测性维护 构建数据预处理技术 构建用于个性化内容或产品推荐的推荐系统 产品优化

承担这些任务的 AI 工程师需要从数据源提取数据。有的使用机器学习模型,有的使用预训练模型或基于规则的系统,具体取决于应用场景及其需求。在此基础上,他们通过 API 调用或嵌入式代码来构建和部署 AI 应用。

为了完成工作,AI 工程师通常需要综合运用多个学科的技能,包括数据工程、软件开发、数据科学和机器学习。

什么是数据工程?

数据工程是指设计和构建用于收集、存储和管理数据的软件,包括开发数据管道、优化数据存储和采集、保障数据完整性和可用性等。

数据工程师从不同来源获取数据,将其转换为可用的格式,然后存储起来(通常是数据库或数据湖)。这些存储下来的数据集被称为数据资产,由数据工程师向其他团队开放,供其进行分析、报表或进一步处理。

AI 工程建立在数据工程之上

尽管两个领域存在差异,但 AI 的核心就是数据。数据工程师专注于收集、存储、转换和处理数据所需的架构和基础设施,而 AI 工程师则需要依赖这些数据来构建智能、高质量、可靠的模型。

数据质量对模型效果影响巨大。机器学习模型本质上就是数据资产,它们依赖高质量、干净且结构良好的数据来做预测、洞察和决策。如果没有完善的数据管道——而这历来是数据工程师的职责——再先进的 AI 模型也无济于事。

好在 AI 工程师可以吸取数据工程师一路走来的经验教训,避免重蹈覆辙。

AI 工程与数据工程:最佳实践

以下五条来自数据工程的经验,是 AI 工程要想成功并具备可扩展性所必须遵循的:

确保管道具备幂等性和可重复性

在数据工程中,让管道具备幂等性——即相同输入每次都产生相同结果——是一项基本实践。这条原则同样适用于 AI 工程,无论你是在构建模型还是使用现成的模型。

AI 工程师经常需要处理大规模数据集、生成 embeddings、存入向量数据库或运行评估。让这些管道具备幂等性,可以避免那些导致系统不可靠的不一致和错误。

实现幂等性的一些做法包括:

为每个数据点分配唯一标识符,确保处理的一致性 设置检查点,即在管道的不同阶段保存状态,出问题时可以从上次成功的位置继续 使用确定性函数,确保相同的输入总是产生相同的输出 跟踪数据集和模型的不同版本,保证一致性

在规划管道时始终把幂等性放在首位,AI 工程师就能确保管道可重复执行,系统在扩展过程中保持稳定。

利用调度实现管道自动化运行

数据工程还会使用定时调度来保证数据处理的一致性和及时性。

很多 AI 工程师往往随意或手动触发管道,依赖在个人电脑上运行的单个 notebook——这种方式容易出错,也无法扩展。他们应该改为构建自动化的数据管道,能够处理重试、失败和部分执行。

有效的调度能让管道运行更一致、数据处理更及时。它还能简化日常维护,减少人为失误,从而让模型训练和数据处理在整体上更加可靠。此外,人工干预减少后,工程师可以把宝贵的时间投入到改进模型等更有价值的事情上,而不必手动管理管道。

让管道可观测

可观测性和数据可见性是数据工程的基础,让团队能够监控管道性能和数据质量。通过检测数据漂移或性能退化,确保模型持续产出准确可靠的结果。有了合适的监控工具和可观测性平台,工程师还能快速修复问题,保证数据和模型完好无损。

AI 工程师同样能从可观测性和数据可见性中受益,比如监控模型占用的计算资源以控制成本、为合规和 AI 伦理最佳实践保留 AI 决策过程的详细日志、以及减少系统停机时间并提升可靠性。

AI 工程师要想跟踪模型健康状况、监控输出并长期采集指标,就必须让管道具备可观测性。

使用灵活的工具和语言进行数据摄取与处理

数据工程要求能灵活应对不同的数据源和格式,通常借助能够从多个来源(结构化数据库和实时流等)摄取和处理数据的工具和语言来实现。能否处理多样化的数据集,是能否扩展的关键。

AI 工程师同样需要这种灵活性,这能让他们的管道更加通用、面向未来。拥有灵活的数据摄取和处理工具,意味着 AI 工程师可以应对不同的数据源、扩展系统、适配新技术、与现有基础设施集成,并在构建越来越多系统的过程中安全高效地进行实验。

归根结底,遵循这一实践能让 AI 系统与其他框架良好协作,从而适应不断变化的业务需求或数据生态。

上线前在多个环境中测试管道

成功的数据工程团队遵循成熟的软件工程交付实践,这些原则同样应应用于 AI 开发。其中一个重要原则是在不同环境中测试管道,数据工程团队借此在问题进入生产环境之前发现环境相关的问题。

在 AI 工程中进行跨环境测试,可以确保 AI 模型最终部署到生产环境时稳定可靠。这还能帮助工程师尽早发现并修复兼容性或性能问题,让部署更顺畅,模型在真实场景中表现更好。

AI 工程师要想确保模型在生产环境中按预期工作,就必须在测试中贯彻同样的纪律。

Dagster 如何助力 AI 与数据工程最佳实践

要践行数据工程最佳实践,你需要合适的工具。

Dagster 是一个现代化的编排平台,让这些最佳实践变得可行且易于落地。

这是因为 Dagster:

通过基于资产的 API 实现管道的一致性和幂等性,追踪数据资产的状态和血缘以确保幂等。 通过 Declarative Automation 提供自定义的事件驱动自动化和灵活调度,团队只需设定数据资产的物化条件,即可实现系统运行的自动化。 从设计上就内置了可观测性和监控能力,包括数据目录(data catalog)和 Insights。目录捕获输出数据资产的元数据,Insights 则让你能看到来自 Dagster 和下游系统的运行数据。 通过丰富的集成和 Dagster Pipes 与其他环境良好协作。Dagster Pipes 允许你将现有 AI 代码和外部执行环境接入 Dagster,轻松访问结构化数据库、实时流等数据源。 通过 Asset Checks 实现覆盖所有环境的充分测试。你可以在管道中直接定义、执行和监控数据质量检查,支持本地开发、staging 和 CI 环境,并规范错误处理和版本控制的流程,打造经过实战检验的可靠管道。

凭借这些功能,Dagster 帮助 AI 团队践行数据工程最佳实践,构建高质量、可扩展且可靠的 AI 系统。

总结

AI 工程就是数据工程。要构建可靠、可扩展、可适应的 AI 系统,AI 工程师需要应用数据工程的经验。通过遵循幂等管道、可观测性与数据可见性、灵活的数据处理以及严格测试等最佳实践,AI 团队可以确保模型取得成功并经久耐用。

借助 Dagster,践行这些最佳实践变得更简单、更高效。通过连接 AI 与数据工程,Dagster 为 AI 工程师提供了一个可以放心大规模落地的平台。

准备好将这些数据工程最佳实践应用到你的 AI 系统中了吗?

了解 Dagster 如何帮助你提升可靠性、精简管道并扩展 AI 项目。访问我们的平台页面了解更多,或联系我们获取演示,我们将向你展示如何构建更智能、更高效的系统。

AI 的未来尚无定论,但有一点是确定的:它必将依赖这些共同的基础,让 AI 系统变得更加高效、强大。

有反馈或问题?欢迎在 Slack 或 GitHub 上发起讨论。想和我们一起工作?查看我们的在招职位。想看更多这类内容?请在 LinkedIn 上关注我们。

评论 (0)