第5章 AI将如何重塑数据工程
数据工程领域的预期将迅速膨胀,工作性质也将随之改变。
如果你是数据工程负责人,了解 C-suite(高管团队)关于 AI 采用的普遍对话和预期将大有裨益,包括对 AI 在劳动力与人员配置方面潜在影响的预判,以及那些能立即提升团队绩效的实用应用场景。
在此,我总结了近期几篇跨领域高管级文章关于 AI 的讨论与发现,并分析这些预测对数据工程的影响。
我们将探索 AI 在长期内改变数据工程版图的两大关键途径: (A) 对数据工程(DE)技能需求的影响 (B) AI 驱动工具在日常数据工程工作中的应用。
在深入探讨这些主题之前,让我们先根据商业新闻的视角,总结一下高管团队如何看待 AI 带来的整体商业机遇:
企业计划在 AI 上投入巨资
几十年来,数据科学在 DecisionOps(决策运营)和机器学习(ML)领域的应用一直蕴含着颠覆企业转型的诱人前景,但对于大多数公司而言,这些实践被证明是繁重且昂贵的。
然而,高管层对生成式 AI(Gen AI)的潜力却感到异常兴奋。他们很可能被 LLM(大语言模型)友好的用户体验所吸引,并看到了这项革命性、多用途技术实现价值的路径——即使团队采用最基础的生成式 AI 工具,也能观察到生产力方面的即时、真实改善。
由供应商支持的报告(例如来自 MIT 的《生成式 AI 在数据与分析领域的现状调查》)正在引发高管层的“错失恐惧症”(FOMO)。麦肯锡“大胆宣称,LLM 和其他形式的生成式 AI 每年可为全球企业利润带来 4.4 万亿美元的增长。” [HBR]
在第一阶段,只有专门的初创企业利用 AI 工具来构建新服务。随后,大型成熟企业开始建立内部模型以获取竞争优势。我们可能尚未见证 AI 在所有行业和所有规模企业中的广泛普及,但这种变化即将到来。
来源:Yahoo! Finance
未来几年内,所有企业都将竞相组建内部团队,以其他数据科学方法未曾实现的方式利用 AI 的力量。因此,行业观察者预测,2024 年的 AI 支出将翻倍,到 2027 年将达到 1510 亿美元(参见 IDC:《生成式 AI 解决方案支出将在 2024 年翻倍,并在 2027 年增长至 151.1 亿美元》)。
分析师预计,行业将从采用 ChatGPT 等能为个人工作流带来即时价值的工具,迅速过渡到将生成式 AI 流程嵌入既定的企业流程中,如客户服务、销售拓展或财务预测。
最终,分析师预计 AI 技术将在所有垂直领域和不同规模的企业中得到快速采用和整合,利用方法包括:各类内部工具和 AI-as-a-Service(AI 即服务)、专用的 AI 点解决方案(编码、聊天机器人、写作助手),以及嵌入所有主要 SaaS 解决方案中的 AI 能力。这可能只是早期炒作周期的一部分,但随着技术快速成熟,分析师们依然保持乐观。
与此同时,人力资源团队正在使用 Evercore AI Impact Navigator 等工具来规划工作范围的变化。
第一部分:数据工程中对 AI 技能的需求日益增长
国际货币基金组织(IMF)的工作人员讨论文件《Gen-AI:人工智能与未来工作》发现,全球近 40% 的就业类型暴露在 AI 的影响范围内,在先进经济体中这一比例更是高达 60%。
这引发了对软件工程岗位可能受到威胁的担忧。IMF 的危言耸听式报告或黄仁勋(Jensen Huang)“我们的工作就是创造计算技术,让没有人需要编程”之类的评论,更助长了这种恐慌。
如今局势稍显平稳,职场分析师预测,虽然重大的颠覆在所难免,但 AI 的出现只会增强对数据工程技能的需求。
数据工程技能需求预计将增长
根据世界经济论坛基于 803 家公司中 1100 万名员工调查得出的《2023 年未来就业报告》,数据领域的职位需求将出现激增,特别是:
Zappia 的一项分析得出结论,数据工程岗位的增长率将从 2018 年至 2028 年保持在 21%,预计未来十年将新增约 28.41 万个职位。
《财富》杂志指出:“即便生成式 AI 取得了进步,该领域仍很可能继续增长,并提供薪酬优厚且富有吸引力的工作。” [薪酬数据在此查看]
共识是数据领域的职位是安全的。最可能遭受打击的是涉及重复性数据处理的工作,如银行职员、邮政职员、收银员,或任何在物理世界和数字领域之间起接口作用的角色。
分析师进一步预测,AI 将对工作范围产生广泛影响,其主要依据是涉及的具体个人任务,而非职位描述本身。在许多情况下,AI 将彻底改造现有的工作,使其面目全非,或创造全新的职业。
数据工程与 AI:界限模糊
随着组织持续采用 AI 相关技术,数据工程与 AI 开发之间的界限正变得日益模糊。事实上,高管并不总是能看出这两种能力之间的差异,但他们都在寻求加速企业范围内 AI 技术的采用。
传统上,数据工程师专注于构建和维护数据管道,确保高质量数据顺畅流动以支持分析和决策。然而,随着 AI 的兴起,数据工程师现在承担着支持更复杂用例的任务,例如训练机器学习模型、管理 AI 应用的数据,以及确保推理工作负载的可扩展性。在 Dagster Labs,我们看到 AI 调用和复杂的数据科学步骤正稳步融入数据管道中。
模型生命周期管理、对 ML 框架的理解以及机器学习的预数据预处理技能将成为必备能力。数据工程师预计将与数据科学家更紧密地合作,将 AI 需求转化为实际的数据架构和工作流。为了跟上这一趋势,数据工程师需要扩展技能组合,包括对机器学习概念的扎实理解、AI 模型的集成/部署,以及熟悉促进 AI 开发的平台。
你的工具链和基础设施准备好了吗?
将 AI 集成到业务流程中,需要能够支持实时和大规模 AI 模型的数据基础设施。那些能够应对 AI 运营复杂性(包括数据版本控制和治理等方面)的工程师将尤其有价值。未来的数据工程师需要演变为混合角色,衔接数据工程、机器学习运维(MLOps)和云基础设施专业知识。
第二部分:AI 工具将重塑数据工程工作流
虽然 AI 需要新技能,但它也将通过根本改变我们的工作方式来赋能数据工程师。
一个典型的例子是 GitHub Copilot,它正迅速成为不可或缺的工具,帮助工程师实时编码和排查问题。MIT Sloan 进行的一项关于 Copilot 对性能影响的研究表明,“开发者的生产力提高了,在微软每周多完成 12.92% 至 21.83% 的拉取请求(pull requests),在埃森哲则是 7.51% 至 8.69%”。总部位于伦敦的教育科技创业者 David Lefevre 就是这样一个转化者:“通过整合 GitHub Copilot 和 ChatGPT 代码解释器等 AI 驱动工具,他的开发团队的生产力翻了三倍。”(《你的工作抗 AI 吗?》 - Shrier, Emanuel, 和 Harris)
尽管如此,专家们一致认为:“如何将 AI 融入知识工作以成功利用这些优势,仍然是一个挑战。”(Maryam Alavi 在 HBR 撰文)
职场观察者发现,AI 采用正在驱动绩效的几个明确模式:
* AI 的采用往往是个人的,而非广泛的流程变革。 * AI 在帮助人们克服学习曲线时价值最大。 * AI 并未取代工作,而是为特定任务提供精准工具。 * AI 工具目前仍是个人支持系统,尚未能协助跨团队协作。
数据工程团队可以超越编码任务,以提升生产力和创造力。
采用 AI 是一段个人旅程
作为工程领导者,很难强制团队全面统一地采用 AI。Maryam Alavi 在《不同领域如何利用生成式 AI 重新定义角色》中写道:“生成式 AI 融入知识工作的方式是流动的,无法精确指定或标准化。”
更具生产力的做法是鼓励实验,分享 AI 如何提升生产力的最佳实践,并让每位团队成员寻找自己的采用路径。
作为工程领导者,你应该鼓励团队成员采用 AI: (A) 处理最具挑战性/最耗时的任务(如复杂编码); (B) 处理最“傻”的事务,例如生成软件发布的变更日志。 [Sourcegraph CEO Quinn Slack]
帮助新成员快速上手的 AI 工具
研究人员发现,编码助手在工程师的上手阶段提供的价值最大。像 Copilot 这样的工具帮助新成员迅速熟悉业务。研究表明,对于经验丰富的工程师,辅助方法很快会到达收益递减点。
“这些早期研究表明,经验较少的员工在应用生成式 AI 进行工作塑造方面,比经验更丰富、绩效更高的同事获益更多。这反过来可能加速新员工的学习和生产力提升,同时减轻资深同事在指导和支持方面的负担。”(Maryam Alavi 在 HBR 撰文)
在较高的专业水平上,强制使用 AI 可能适得其反。引用一项在呼叫中心强制使用 AI 的研究,Waber 和 Fast 写道:“……顶尖员工的绩效在该系统下实际上下降了,这给创新、激励和留住公司最佳表现者带来了潜在问题。”(参见《生成式 AI 对生产力的影响是否被夸大了?》)
关于这项研究的更多信息,可在斯坦福大学商学院的非门禁文章《生成式 AI 无需取代员工即可提升生产力》中找到。
不取代工作,而是处理任务
“任务,而非工作,将是未来职场变革的构建模块。” Ghosh, Wilson 和 Castagnino 在 HBR 中写道。他们建议,AI 不会取代角色或职能,而是促使公司重新定义现有工作的范围。
他们特别指出了数据领域:“以数据科学家的职位为例,76% 的工作时间可能受到生成式 AI 的影响,在现有技术水平和实践下,可使可达到的生产力提高 25%。”
“我们看到更大效应的地方在于生产力的加速或增强,例如,资深软件工程师利用 AI 系统自动完成大部分代码开发,然后手动调整代码以进行优化。”(参见《你的工作抗 AI 吗?》 - Shrier, Emanuel, 和 Harris)
行业评论人士强调了个人提升技能的重要性,以及知道何时依赖 AI 来协助任务,如字段映射、文本分析、让利益相关者自助服务,以及通常集成第三方 AI API。
“作为一个经验法则,涉及重复流程的任务是生成式 AI 完全自动化的候选者,而需要创造性推理、协作和判断的任务则是 AI 增强的候选者。”(Bhashkar Ghosh, Accenture)
个人助手,但无多人模式
分析师观察到的另一个现象是,AI 工具正在为个人从业者带来价值,但尚未破解提升跨团队协作绩效的代码。
AI 当然可以消除团队协作中的一些琐碎工作(如会议纪要总结、变更日志维护、头脑风暴会中帮助扩展想法等),但尚未真正促进更好的协作。
AI 最具前景的潜力之一在于学习团队最佳实践,并指导整个团队而非单个成员达到更高的生产力水平。但我们尚未到达那里。
最近的案例研究(如 McKinsey 或 Boston Consulting Group)指出该领域出现了有希望的发展,但最终仍归结为帮助个体更高效能的生产力工具,而非真正改善团队协作。
超越编码:创造力与构思
数据领域的供应商大胆宣称 AI 可以监控管道、创建仪表板,并处理许多数据工程师当前关注的高阶任务。虽然我们的工具尚未实现这一前提,但我们应该预期数据工程工具包开始处理这些更苛刻的任务,使工程师能投入更多时间进行战略决策和创新。
在此处,AI 也能提供帮助。生成式 AI 非常适合扩展想法,并为团队生成的想法列表增添内容。它有助于创建更全面的可能解决方案列表以供探索。
但请注意,在某些研究中,在构思会议中引入生成式 AI 被证明会扼杀创新:参见 GeoLab CEO Kian Gohar 的文章《不要让生成式 AI 限制你团队的创造力》。
展望未来
生成式 AI 的出现只会提高人们对数据工程职能能交付价值的预期,但高管们预计这需要大规模的投资。作为工程领导者,我们需要理解数据如何在业务中驱动价值,并准备好与管理层合作以释放这一价值。
AI 对数据工程职位的长期影响是一个转型的故事——既涉及所需技能集,也涉及工作性质本身。数据工程师需要拥抱 AI 既是挑战也是赋能者:获取新的 AI 相关技能以满足行业日益增长的需求,同时利用 AI 工具提升生产力并增强创造力。未来将青睐那些适应这些变化的工程师,他们兼具传统数据工程专长与不断演进的 AI 优先方法。
有反馈或问题?请在 Slack 或 Github 发起讨论。 想与我们合作?查看我们的开放职位。 想要更多此类内容?在 LinkedIn 上关注我们。