← 文章 / 未分类
squarespace 2小时前 · 2026-09-02 00:05:52 · 3 阅读

Stability AI 与 Arm 合作发布 Stable Audio Open Small,推动设备端音频生成实现真实世界部署——Stability AI

  • 我们现已开源 Stable Audio Open Small。这是一款拥有 3.41 亿参数、针对 Arm CPU 优化的文本生成音频模型,可完全在 Arm CPU 上运行。它专为快速生成短音频样本而设计,能在智能手机上用不到 8 秒生成最长 11 秒的音频。

  • 此次发布延续了我们与 Arm 的合作,旨在将生成式音频创作带到智能手机上。此前,我们已在世界移动通信大会(Mobile World Congress)上宣布这一进展

  • 开发者可以参考全新的 Arm Learning Path,通过实践教程学习如何在 Arm CPU 上使用 Stable Audio Open Small。

  • Stable Audio Open Small 现已根据宽松的 Stability AI Community License,免费用于商业和非商业用途。你可以在 arXiv 阅读论文,在 Hugging Face 下载模型权重,并在 GitHub 获取代码。

下载模型权重

将生成式音频创作带到手机上

我们与 Arm 合作开源了 Stable Audio Open Small。目前,全球 99% 的智能手机都采用 Arm 技术。作为行业领先的文本生成音频模型 Stable Audio Open 的紧凑版本,新模型体积更小、速度更快,同时保持了输出质量和对提示词的遵循度。

此次发布是在我们此前宣布一项突破之后进行的:借助 Arm 的 KleidiAI,Stable Audio Open 现已针对 Arm CPU 优化,可在手机上生成 AI 音频。在世界移动通信大会上展示这项技术后,Stability AI 与 Arm 现已开放模型权重,任何人都可以访问并部署该模型。

技术进展

据我们所知,Stable Audio Open Small 是目前市场上速度最快的立体声文本生成音频模型。有关该模型技术进展的更多信息,请参阅研究论文。以下是几个亮点:

轻量:Stable Audio Open Small 拥有 3.41 亿个参数,而 Stable Audio Open 的参数量为 11 亿。

快速:Stable Audio Open Small 经过优化,可在手机上于 8 秒内生成音频。无论是生成音频还是进行 fine-tuning,速度都更快。

高效:借助 Arm 的 KleidiAI 库,我们设计了这款新模型,使其能够在边缘设备上实现更高效的运行。用户不仅能更快获得结果,还能降低计算时间成本。Stable Audio Open Small 完全运行在 Arm CPU 上,因此无需高性能硬件也能使用。

适用场景

与 Stable Audio Open 一样,Stable Audio Open Small 针对通过文本提示生成短音频片段、音效和制作素材进行了优化,尤其适合创作鼓组循环、拟音、乐器 riff 和环境氛围音。

凭借紧凑的体积和快速推理能力,它非常适合部署在搭载 Arm 芯片的智能手机和边缘设备上,满足实时生成与快速响应的需求。

随着 AI 驱动的创意媒体工作负载转向边缘侧,更小的模型有助于让计算资源与任务复杂度相匹配。组织可以根据不同使用场景选择合适大小的模型,将工作负载分配给最适合的处理器,例如生成短音效或完整歌曲。

开始使用

目前,Stable Audio Open Small 已依据宽松的 Stability AI Community License 开放免费商用和非商用。你可以在 arXiv 阅读论文,在 Hugging Face 下载模型权重,并在 GitHub 获取代码。

访问 Arm 学习路径,了解如何在 Arm 硬件上部署 Stable Audio Open Small;还可以阅读 Arm 社区博客,深入了解 Stable Audio Open Small 针对设备端性能所做的优化。

想及时了解我们的最新进展,欢迎关注 XLinkedInInstagram,并加入我们的 Discord 社区

访客用户
原始来源: squarespace

评论 (0)