Stability AI 与 Arm 合作发布 Stable Audio Open Small,推动设备端音频生成实现真实世界部署——Stability AI
我们现已开源 Stable Audio Open Small。这是一款拥有 3.41 亿参数、针对 Arm CPU 优化的文本生成音频模型,可完全在 Arm CPU 上运行。它专为快速生成短音频样本而设计,能在智能手机上用不到 8 秒生成最长 11 秒的音频。
此次发布延续了我们与 Arm 的合作,旨在将生成式音频创作带到智能手机上。此前,我们已在世界移动通信大会(Mobile World Congress)上宣布这一进展。
开发者可以参考全新的 Arm Learning Path,通过实践教程学习如何在 Arm CPU 上使用 Stable Audio Open Small。
Stable Audio Open Small 现已根据宽松的 Stability AI Community License,免费用于商业和非商业用途。你可以在 arXiv 阅读论文,在 Hugging Face 下载模型权重,并在 GitHub 获取代码。
将生成式音频创作带到手机上
我们与 Arm 合作开源了 Stable Audio Open Small。目前,全球 99% 的智能手机都采用 Arm 技术。作为行业领先的文本生成音频模型 Stable Audio Open 的紧凑版本,新模型体积更小、速度更快,同时保持了输出质量和对提示词的遵循度。
此次发布是在我们此前宣布一项突破之后进行的:借助 Arm 的 KleidiAI,Stable Audio Open 现已针对 Arm CPU 优化,可在手机上生成 AI 音频。在世界移动通信大会上展示这项技术后,Stability AI 与 Arm 现已开放模型权重,任何人都可以访问并部署该模型。
技术进展
据我们所知,Stable Audio Open Small 是目前市场上速度最快的立体声文本生成音频模型。有关该模型技术进展的更多信息,请参阅研究论文。以下是几个亮点:
轻量:Stable Audio Open Small 拥有 3.41 亿个参数,而 Stable Audio Open 的参数量为 11 亿。
快速:Stable Audio Open Small 经过优化,可在手机上于 8 秒内生成音频。无论是生成音频还是进行 fine-tuning,速度都更快。
高效:借助 Arm 的 KleidiAI 库,我们设计了这款新模型,使其能够在边缘设备上实现更高效的运行。用户不仅能更快获得结果,还能降低计算时间成本。Stable Audio Open Small 完全运行在 Arm CPU 上,因此无需高性能硬件也能使用。
适用场景
与 Stable Audio Open 一样,Stable Audio Open Small 针对通过文本提示生成短音频片段、音效和制作素材进行了优化,尤其适合创作鼓组循环、拟音、乐器 riff 和环境氛围音。
凭借紧凑的体积和快速推理能力,它非常适合部署在搭载 Arm 芯片的智能手机和边缘设备上,满足实时生成与快速响应的需求。
随着 AI 驱动的创意媒体工作负载转向边缘侧,更小的模型有助于让计算资源与任务复杂度相匹配。组织可以根据不同使用场景选择合适大小的模型,将工作负载分配给最适合的处理器,例如生成短音效或完整歌曲。
开始使用
目前,Stable Audio Open Small 已依据宽松的 Stability AI Community License 开放免费商用和非商用。你可以在 arXiv 阅读论文,在 Hugging Face 下载模型权重,并在 GitHub 获取代码。
访问 Arm 学习路径,了解如何在 Arm 硬件上部署 Stable Audio Open Small;还可以阅读 Arm 社区博客,深入了解 Stable Audio Open Small 针对设备端性能所做的优化。
想及时了解我们的最新进展,欢迎关注 X、LinkedIn 和 Instagram,并加入我们的 Discord 社区。
访客用户