Kubeflow扩展了AI功能,项目临近CNCF毕业
Kubeflow项目发布了多项技术更新,以增强 Kubernetes 上的分布式 AI 和高性能计算能力。这些进展包括 Kale 2.0,这是一个具有原生 Spark 支持的现代化 SDK,以及 Kubeflow Trainer 功能的扩展。这些发展标志着该项目正向云原生计算基金会(Cloud Native Computing Foundation,CNCF)毕业阶段迈进。

一个重大的更新是Kale 2.0的发布。这个工具可以将标注的 Jupyter notebooks 转换为生产就绪的管道,而无需编写任何 KFP SDK 代码。更新版本现在支持 Kubeflow Pipelines v2 架构。这使数据科学家能够避免手动创作管道,更快地从实验转向生产。
Kubeflow 项目正在迅速推进在 CNCF 毕业,强调其演进为成熟的、生产就绪的 ML 生态系统。
该项目也即将发布Kubeflow Notebooks v2。这是一个从头开始的重新设计,采用声明式 CRD 驱动的架构。它为平台团队提供了对交互式环境(比如,Kubernetes 上的 JupyterLab 和 VS Code)的模板化控制。Alpha 版本现已可用,帮助用户在正式发布前测试这些新功能。
Kubeflow SDK的技术更新引入了原生 Spark 支持。这使用户能够在 Kubernetes 上运行 Spark,而无需编写基础设施配置。SDK 为数据处理和管道编排以及分布式训练和超参数调优提供了统一的 Python 接口。它还包括用于微调大语言模型的内置蓝图。计划的更新内容包括添加 OpenTelemetry 检测和 MLflow 跟踪,以改进 AI 生命周期的可观测性。
新的Kubeflow Trainer旨在通过 MPI 支持统一的分布式 AI 训练和高性能的计算工作负载。Andrey Velichkevich在LinkedIn上写到,该训练器现在正式与 Flux Framework 进行集成。这允许用户在单个 Kubernetes 环境中使用 Process Management Interface Exascale 进行协调,同时运行大规模 HPC 模拟和 AI 训练 job。
这是在云原生基础设施中采用 HPC 技术的巨大一步,这对现代 GenAI 工作负载至关重要。
Luca Berton在LinkedIn上指出,Kubernetes 和云原生技术正成为生产环境 AI 的基础层。他指出,Subaru Corporation 最近通过使用 Kubernetes 和 Argo CD 在 CNCF 案例研究竞赛中获胜,将大于 30 GB 的 AI 容器镜像的拉取时间从三小时减少到仅三分钟。
核心平台组件也有更新。Model Registry 已更名为 Hub,以反映它现在包括 Model Catalog 和 MCP Catalog 的更广泛范围。这使得用户能够使用 OCI 作为模型存储的标准来搜索和部署 MCP 服务器。KServe 引入了 LLMInferenceService CRD,使大语言模型服务成为一等的平台原语(platform primitive)。此更新支持跨多个节点的分布式推理,并提供与 OpenAI 兼容的 API。
Kubeflow Community Distribution 26.03 版本专注于可扩展性和安全性。它已被正式验证支持 Kubernetes 1.34 及更高版本。本次更新加强了多租户默认设置,并实现了与 Pod Security Standards Restricted 策略的兼容性,以确保更严格的安全合规性。这些变更帮助组织以更好的可靠性运行大规模的 Kubeflow。
通过新的外联项目(Outreach Program )和 ML 体验工作组(ML Experience Working Group),社区参与度也在增加。这些举措旨在通过改进用户界面和为贡献者提供指导来降低参与门槛。
查看英文原文:Kubeflow Expands AI Capabilities as CNCF Graduation Nears