← 文章 / 云原生与基础设施
InfoQ 2小时前 · 2026-08-31 10:16:43 · 1 阅读

InfoQ 2026 年云计算与 DevOps 趋势报告

InfoQ 趋势报告就我们认为架构师和技术领导者应优先关注的主题为 InfoQ 的读者提供了简明且富有见解的概述。除了本报告和最新的 DevOps 及云计算 InfoQ 趋势图表外,我们还提供了一期配套播客,其中有几位 InfoQ 编辑与 InfoQ 的朋友就这些趋势展开了讨论。

年度趋势报告的一个重要组成部分是趋势图表,它展示了哪些趋势和主题已经进入了创新者类别,哪些已被提升至早期采用者和早期多数类别。这些类别是根据 Geoffrey Moore 的著作《跨越鸿沟》(Crossing the Chasm)来划分的。在 InfoQ,我们主要关注尚未跨越鸿沟的类别。以下是今年的趋势图:

自去年 InfoQ 团队讨论趋势报告以来(参见下方的 2025 年趋势图),已经出现了一些重大的创新和发展。

本文重点介绍了趋势图,上面展示了技术采用的不同阶段,并详细介绍了自去年趋势报告发布以来新增或升级的各项技术。此外,我们还探讨了采用趋势图中被重点推广的技术和趋势。

以下是自去年报告发布以来发生的一些主要变化。

创新者

在我们的采用趋势图中,第一类是创新者,其中涵盖了当前仅由最具前瞻性的团队在开发的新兴方法。今年,新入榜的项目反映出,AI 基础设施已经迅速成为架构设计中的首要关注点。

企业级 AI 平台与 AI 网关

今年最明显的转变之一,是从独立的 AI 助手向集中管理的 AI 平台转型,尤其是在企业内部。企业不再让每个团队各自搭建模型,而是开始构建内部 AI 平台,其中配备了集中式网关、经过审批的模型目录以及预配置的团队工作区。这种模式直接借鉴了成熟的 API 管理理念,并将其应用于模型、工具和智能体。

Steef-Jan Wiggers:这是一种“毂辐式(hub-spoke)”模型,其中有集中式 AI 网关,基本上就是你所说的 API 管理,只不过是针对 AI 的。我认为 Apigee 具备这一功能,微软也有自己的 API 管理方案,但你也可以将其定位为 AI 网关。在其背后,有一个集中式的模型目录,其中包含允许使用的模型。随后,这些模型将流向所谓的“辐条”,也就是在平台上进行开发的团队。

这些平台仍然处于早期阶段。正如 Wiggers 所指出的那样,毂辐式模型在实践中将如何展开,目前仍然是一个未知数。但发展方向毋庸置疑:通过模型路由实现成本控制,通过内部托管保障数据主权,并建立受管控的模型目录,以避免上百个团队各自为政地做出模型决策。

面向 AI 和 Token 经济的 FinOps

云端 FinOps 是一门成熟的学科,但 AI 支出开辟了一片新领域,而现有工具尚未能充分覆盖这一领域。Token 消耗已经成为一项主要的运营开支。与会专家坦率地指出,将这部分支出与价值挂钩的问题还没有得到解决。Matt Saunders 直截了当地指出了这一矛盾。

Matt Saunders:FinOps 工具可以告诉你,Matt Saunders 在 Opus、Fable、Sonnet 等平台上分别花费了 X、Y、Z 美元购买 Token。但据我所知,没有一款工具能够真正将这些支出与实际成果联系起来。

Renato Losio 指出,AI 成本往往是其他因素的替代指标,这使得其优化难度远高于存储类别或数据传输等确定性成本项目。此外,还存在更深层次的不确定性:当前的模型定价究竟是为了通过补贴来实现用户锁定,还是真实地反映了长期成本。Shweta Vohra 则从 FinOps 基金会的视角阐述了这一问题的本质。

Shweta Vohra:当前智能体带来的混乱程度,甚至超过了我们此前经历的微服务时代。在 AI 和云优化方面,我们已经遭遇了巨大的资源浪费这块“巨石”。但现在,我们面临着智能体形式的小型机遇与挑战——智能体如此之多。与那些大模型、巨额投资和 MLOps 相比,我们现在面对的只是些“小石子”。我们需要将它们收集起来并理清头绪。正因如此,FinOps 基金会也分出了 Tokenomics 基金会。与此同时,Agentic AI 基金会也在 Linux 基金会旗下应运而生。

主权云战略

数字主权已经从政策层面的讨论转向架构层面的探讨,尤其是在欧洲。各组织正在评估究竟需要采取哪些实际的措施,才能将数据——以及越来越多的模型——保留在区域边界之内。从业者的坦率回答是,鉴于企业基础设施的很大一部分都构建在美国平台和 SaaS 之上,要实现完全的主权控制非常困难。Steef-Jan Wiggers 指出,在他供职的公司中,几乎所有的应用程序、系统和超大规模云服务商都是美国的,甚至包括核心策略系统在内。因此,要实现完全的主权,就意味着几乎要对所有系统进行重建和重新设计。欧洲供应商可以提供 IaaS 和存储服务,但在平台和 SaaS 层——例如 Salesforce 这样的 CRM 系统——却没有明显的主权替代方案。

Renato Losio 对此持怀疑态度。他认为,当前欧洲出现的这波替代方案在技术深度上尚无法与超大规模云服务商相媲美。

Renato Losio:在欧洲,大多数提供替代方案的服务商,其实主要是在搞营销。他们提供的服务水平远不足以成为真正的替代方案。这让我想起 S3 推出的早期阶段,当时人人都声称拥有 S3 后端,但实际上不过是一台运行着 S3 API 的单一服务器罢了。

不过,他也承认,推动“主权区域”的举措至少让各团队意识到了一个此前许多人未曾考虑过的挑战。Mark Silvester 则从其受监管的欧洲客户群中得到了一个具体的反向信号。

Mark Silvester:我们的所有客户都在欧洲,而且他们坚决要求将所有数据都保留在欧洲境内。实际上,大约一半的客户正在逐步迁回本地部署。这绝对是我观察到的一种趋势。

早期采用者

在早期采用者类别中,我们重点介绍了用于云工程的 AI 智能体,以及更广泛的 AI 智能体基础设施竞赛。去年,我们将用于云工程的 AI 智能体归类于创新者类别;今年,尽管治理方面的摩擦依然存在,但其应用已经取得了长足的进展,因此我们将其晋升至早期采用者类别。

用于云工程的 AI 智能体

超大规模云服务商已经将智能体视为重点产品,而非要研究的新鲜事物。各大云平台相继推出了智能体注册中心、DevOps 智能体以及沙箱执行环境。Steef-Jan Wiggers 将此描述为一场基础设施军备竞赛。

Steef-Jan Wiggers:我认为,智能体基础设施的“军备竞赛”基本上已经打响。我们可以看到,许多超大规模云服务商已经在相关产品上投入了大量的资源。例如,亚马逊云科技推出了智能体注册中心和 DevOps 智能体。我认为微软也有 DevOps 智能体。此外,谷歌推出了 GKE 智能体沙箱,Cloudflare 则推出了动态工作负载服务。其中一些超大规模云服务商正在将 AI 基础设施真正地融入其产品之中。

然而,企业级应用的推广仍然受到治理和合规性的制约。Mark Silvester 和 Wiggers 均在受监管的环境中工作,他们描述了同样的问题:各个团队在缺乏共同基础的情况下争先恐后地推进 AI 应用,这导致了重复工作,并面临着诸如《数据开放与责任法案》(DORA)所要求的安全与合规管控措施。在这些组织中,一个反复出现且值得深思的问题是:某个特定的问题是否真的需要 AI,还是说它可以通过像输入管理这样的现有能力得到解决。

智能体基础设施与治理自动化

除了单个的智能体之外,一种更具微服务风格的模式正在兴起:分别用于编码、测试和持续集成(CI)的专用智能体,它们相互协调,而非被单一的全能模型所取代。Matt Saunders 将这一年概括为两类团队的分水岭:一类押注于规模日益庞大的前沿模型,另一类则构建专为特定目的而设计的小型智能体。哪种理念将胜出,或者它们是否会趋于融合,是明年最值得关注的问题之一。

治理工具正在逐步跟上这一发展步伐。Saunders 重点提到了 MCP 集中式身份验证功能的推出,这解决了该协议早期最突出的问题之一:智能体会继承其创建者的权限。

Matt Saunders:我最近刚在 InfoQ 上发表了一篇文章,介绍了 MCP 现在已经支持集中式身份验证。现在有一个用于集中式身份验证的插件。我曾经认为,MCP 在引入时会完全无视组织内部现有的权限以及身份与访问管理(IAM)机制。这不可避免地导致了其采用率未能达到本应有的水平。

早期多数

我们正在将平台工程和模型上下文协议纳入早期多数类别。这两者都已经发展得相当成熟,相关讨论的焦点也已经从“是否采用”转向了“在大规模场景下如何运行它们最好”。

平台工程

平台工程已经悄然成为基础性工作。与会专家将其描述为:在非人工智能领域的工作正处于一种富有成效的维持状态:稳定、被充分理解,而且不再是令人兴奋的前沿领域;而自主式 AI 则已经成为平台团队新的实验方向。平台团队的角色正在从“建设者”向“赋能者”转变:通过标准化 AI 能力,避免各团队重复造轮子;同时减少因核心服务不够完善而出现的“影子平台”。

Mark Silvester:在我们所合作的客户中,这可能已经成为平台工程团队的主要关注点:帮助客户成为“AI 原生”的赋能者,确保平台不会总成为瓶颈。如果平台不够完善,那么各团队就会想用完全不同的方式自己动手实现。

Matt Saunders 将该领域中非人工智能相关的工作描述为处于一种富有成效的维持状态:团队不再争论如何使用 Terraform 构建基础设施最好,而是聚焦于数据主权、模型托管以及前沿模型的访问控制,致力于探索如何在平台层面创造价值,从而避免各个团队各自为政。Shweta Vohra 认为,尽管更广泛的社区仍然在争论平台工程的本质,但在实践中,该领域已经进入早期多数阶段。在 KubeCon 大会上,她发现,约 70% 的与会者认为平台工程只是 DevOps 改了个名。这表明,尽管相关工具已趋于整合,但人们对这一领域的认知尚在不断成熟的过程中。她还进一步厘清了这两个角色之间的区别。

Shweta Vohra:如今,平台工程师和开发人员之间必须有所区分。开发人员需要专注于更高的抽象层,而平台工程师则可以继续扎根于引擎、基础设施、Kubernetes 等底层技术。现在是迈向平台工程 2.0 的时候了。基于智能体的开发门户(Agentic developer portals)是一种新兴事物,目前尚处于早期阶段——就像我们之前看到的 IDP 一样——但这次它会更快地成熟。我建议将 AI 原生平台 作为下一个重要的发展方向。这一领域未来会有更多的发展空间。

模型上下文协议(MCP)

MCP 正迅速成为 AI 工具的默认集成协议。该协议由 Anthropic 于 2024 年底推出,旨在规范模型与外部工具及数据的连接方式。

今年的讨论重点已经不再是 MCP 是否重要,而是如何安全地运行它:应暴露多少工具接口、如何实施最小权限原则,以及如何将其纳入现有的身份和访问控制体系。Shweta Vohra 指出,限制 MCP 暴露的工具的范围已经成为标准的合规检查点,而集中式身份验证(如上所述)的出现标志着该协议已经实质性地迈入了企业级应用阶段。

Vohra 还提到了成立于 2025 年底的 Agentic AI 基金会,认为这是一项令人鼓舞的标准化工作。标准化是企业所需的安全与合规成熟度的先决条件,尽管相关工作尚处于初期阶段,但发展方向是积极的。

后期多数

后期多数类别涵盖了目前已被全面采用并视为核心架构的技术。今年,有一个主题在这一类别中再次成为焦点:可靠性。

云计算的可靠性与弹性

尽管人工智能备受关注,但对 Renato Losio 而言,最令人惊讶的趋势却与之毫无关系。那就是在过去的一年中,各大云服务在可靠性方面的表现有多差——从长时间的区域性中断,到美国一个核心区域宕机并导致互联网大部分区域受影响的广泛服务中断。

Renato Losio:真正让我感到惊讶的是,在过去的一年中,主要云服务提供商的可靠性竟然如此之差。如果一年前有人告诉我,亚马逊云科技的一个区域会停机六个月,我根本无法想象。此外,去年 10 月美国弗吉尼亚区域也停机了数小时,对半个互联网都产生了相当大的影响。

这其中蕴含的教训虽然老生常谈,但值得再次强调一下:多区域设计、运维就绪性和弹性能力,绝不是采用最新服务后才需要附加的可选功能。随着新的人工智能工作负载给运算能力带来了压力,可靠性的基本要素变得愈发重要,而非相反。

面向云的 FinOps 和可观测性

传统的云 FinOps、针对存储类型与数据传输的优化、计算资源优化以及可观测性,仍然是被广泛采用且成熟的实践。正如 Losio 所言,云资源浪费中的大问题已经基本得到解决,该领域中剩下的问题只是渐进式的。正如创新者一节所述,前沿领域已经转向人工智能支出。用于确定性云成本管理的工具已经相当成熟,各供应商正将其应用范围扩展至可持续性和绿色计算报表领域,多位小组讨论成员都认为这确实非常有用。

注意事项:哪些东西可能被高估了

每年我们都会询问专家小组,听众应该对哪些趋势保持警惕。今年的共识主要集中在区分实质性内容与营销噱头上。

  • 智能体的盲目叠加。Wiggers 提醒大家,警惕那些在产品中生硬地添加智能体却未带来任何附加值的情况,这让人联想到此前 DevOps 表面功夫的时代。在医疗保险等受监管的领域,完全自主决策根本是不被允许的;必须有人类或医生参与其中。我们需要思考的问题是:智能体在哪些方面真正地创造了价值,而在哪些方面并没有。

  • 企业中的全自主代理。Mark Silvester 和 Shweta Vohra 都呼吁让人类始终参与其中,其中 Vohra 提醒各团队,要关注更深层次的问题,如智能体协同网络和控制框架,而不是被花哨的门户和表面功能所吸引。

  • 托管式 AI 服务的过度泛滥。Renato Losio 预测,一些频繁更名和重新包装的云 AI 服务将在未来十二个月内难以为继,而开发者将越来越关注实际成果,而非助手背后运行的是哪种模型。

  • 关于工程师消亡的预测。Matt Saunders 认为,关于 AI 将取代初级或高级工程师的论调正在消退,那些关于世界将彻底改变的更激进的多年期预测也同样如此。

小结

如果说去年的报告聚焦于整合,那么今年的报告则关注压力下的执行。人工智能已经从实验阶段迈入落地实施阶段,这一转变正在同时重塑云战略、平台工程和 FinOps 等领域。各组织正在构建受监管的人工智能平台,努力应对现有工具尚无法有效应对的 Token 经济问题,并将主权视为具体的架构约束而非抽象的关切。

与此同时,一系列备受瞩目的服务中断事件让可靠性再次成为讨论的焦点,这提醒我们:即便技术前沿不断推进,诸如多区域设计、运营就绪性以及清晰的人工治理等基本要素,其重要性也不会因此而减弱。该小组最强烈的共识建议是:抵制 AI 过度炒作,并持续追问自动化究竟在何处真正地创造了价值。

在未来的十二个月中,最具竞争优势的团队将是那些能够将人工智能赋能的执行能力与平台治理及客观评估相结合的团队,将热情转化为持久的价值,而非不断累积的成本和复杂性。正如 Daniel Bryant 在配套播客的总结中所言:炫目的技术固然引人注目,但基本功依然是核心。

原文链接:https://www.infoq.com/articles/cloud-devops-trends-2026/

原始来源: InfoQ

评论 (0)