PrismML 想用超小型 LLM 改变 AI 的使用方式
如果 AI 实验室 PrismML 还没进入你的视野,那现在该关注了——不是因为它融了大笔资金(目前只有 2225 万美元的种子轮),而是因为其背后的技术团队,以及它正在开发的可能改变整个行业的技术。
PrismML 的赌注是:能力强大、推理性能出色的 LLM,其实未必非得庞大不可。
它正在把推理模型做到足够小,小到能装进 PC 和智能手机。(甚至有传闻称它正在与 Apple 洽谈合作,不过 CEO Babak Hassibi 拒绝就此向 TechCrunch 置评。)
本周四,PrismML 发布了 Bonsai 2 27B,这是其模型家族的最新成员。它把 Alibaba 广泛使用的开源模型 Qwen3.8 27B 压缩到 5.9 GB——小到足以放进一台 PC,甚至可能塞进高端智能手机。相比原模型,内存占用缩减了 9 到 10 倍。
PrismML 由一群 Caltech 研究人员创立,由压缩技术专家、Caltech 教授 Hassibi 领导。这家初创公司还请来了 Ion Stoica 担任顾问。Stoica 是 Databricks 等多家公司的联合创始人,同时执掌 Berkeley 著名的 Sky Computing Lab——这个实验室孵化出了大量技术和初创公司,从 Letta 到 SGLang。
PrismML 的投资方包括 Khosla Ventures、Cerberus Capital 和 Caltech。
当然,这家公司并不是唯一在研究 LLM 压缩技术的企业。由西班牙 Donostia 国际物理中心一位知名教授创立的 Multiverse Computing 便是其中之一(而且 Multiverse Computing 已经融到了大笔资金)。
Hassibi 表示,PrismML 压缩技术之所以独特,是因为其 LLM 与原模型相比几乎没有性能损失。Bonsai 2 达到了 Qwen 综合基准测试得分的 98%,而几月份发布的初代 Bonsai 仅为 95%。公司称,初代模型已被下载超过 1100 万次,而 PrismML 更小的模型又被下载了 260 万次。 这表明 PrismML 的压缩效果在后续版本中得到了提升。但它能否达到 100% 的基准性能对等,目前尚待观察。Hassibi 认为,压缩很可能会始终产生 一定 影响。 不过,完美的基准对等在实践中其实更偏向理论层面。未压缩的 LLM 本身精度有限,基准测试也难以完美反映实际任务,因此 2% 的性能下降不太可能对模型在实际使用中的表现产生重大影响。此外,围绕模型的软件层(即模型运行的 harness)在准确性上也< a href="https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/">至关重要。 PrismML 表示,其通过压缩构成模型的“权重”来实现这一目标——权重本质上是模型在训练期间学习和存储的信息。通常,每个权重需要 16 位。PrismML 的方法称为“三元”权重,将其简化为 +1、−1 或 0。由于每个权重存储的数值更小,模型占用的空间大幅减少。(如需深入了解压缩技术,可访问项目的 Hugging Face 页面。) 该初创公司的下一个目标是将此压缩技术应用到更大的模型上。“我们接下来将在未来几个月内发布的模型,参数规模将在数百亿级别。我预计在这些模型上保留智能会更轻松,”Hassibi 告诉 TechCrunch。 他补充道,随着模型规模增大,“在保持智能不丢失的前提下,可压缩的空间更大。因此总体而言,对于大模型,达到 100% 的保真度更容易。”Stoica 表示,他很看好这项技术,因为它能让先进模型直接在用户设备上运行。“智能将触手可及,而且是免费的,因为它运行在你已经买过的设备上。它也很私密,因为你不需要把数据传到云端。”