上下文窗口限制被打破:Subquadratic推出了一个1200万Token的窗口
日程已上线 100%!6.26-27 AICon 上海站: 13大专题+1个动手实验室、近60场重磅议题,集结清华、复旦等知名高校教授及阿里、腾讯、字节、小红书、Google Cloud等头部企业技术专家,围绕Agent工程化落地等相关议题展开分享, 点击了解详情
本文最初发布于 THENEWSTACK。
2026 年,每个前沿模型都在宣传,至少提供 100 万 Token 的上下文窗口。但实际上,几乎没有一个模型能够很好地利用所有这些信息。在
目前,100 万 Toekn 似乎是主要前沿实验室提供的最大上下文窗口。一个主要原因是,这个 100 万 Token 的最大值影响了自
该公司拥有 11 名博士研究员。他们认为,其 Subquadratic Selective Attention(SSA)架构在计算和内存方面均与上下文长度呈线性增长关系。该公司表示,在 100 万 Token 的规模下,其运行速度比密集注意力快 52 倍;在 1200 万 Token 的“大海捞针”检索任务中,准确率达到 92.1%。这一上下文长度是当前任何前沿模型都难以企及的;而且,其模型在 MRCR v2 测试中获得了 83 分,比 OpenAI 高出 9 分。
这些说法颇为大胆,而且 Subquadratic 也不是首个尝试解决这一问题的团队。该公司发布的基准测试成绩令人印象深刻,其中还包括在 SWE-bench 测试中获得 82.4%的得分,这一成绩超越了 Anthropic 的上一代模型
Subquadratic 通过 API 提供了该模型(具有 1200 万个 Token 的上下文窗口)以及一个编码代理(SubQ Code)和一个深度研究工具(SubQ Search)。
之前的技术
显然,注意力的二次方成本不是一个新问题,SSA 也不是第一个试图解决这个问题的方法。研究线可以追溯到最初的 Transformer 论文,总体模式一直没有变。每种方法都是用一个必要的属性交换另一个属性,在前沿领域里,没有一个能够取代密集注意力机制。
举例来说,在这些不同的方法中,其中一个是固定模式稀疏注意力。在
像
对于这个问题,
最新的研究则另辟蹊径。它们不再试图修复模式或压缩状态,而是学习该关注哪些位置。
例如,DeepSeek 的
SubQuadratic 首席技术官
SSA 的不同之处
SSA 的卖点在于它做到了 DSA 试图完成的工作,但避免了索引器陷阱。选择是内容依赖的。对于任何给定的查询,模型都会根据查询和键中实际包含的内容来挑选重要的关系——最重要的是,选择机制本身不会呈二次方增长。
Whedon 说,“对于提示 A,第一和第六个词对彼此来说很重要。对于提示 B,可能是第二和第三个词。每个输入情况都不同。”
根据 Whedon 的说法,混合模型提供了“标量效益”,但纯粹的次二次方机制提供了一个缩放法则优势。在基准测试中,SubQ 报告了 128K 时 7.2 倍的速度提升,以及 1M 时 52.2 倍的速度提升。
基准测试
在 128K 的
在
需要注意的是,按照该论文的说法,因为推理成本高,每个模型只运行了一次。正如论文所承认的那样,在 SWE-Bench 测试中,模型得分差异可能来自于模型治理工具(Harness),也可能来自于模型。而且,根据 Whedon 自己的描述,SubQ 模型“比大实验室的模型小很多”。
Subquadratic 现在正准备推出什么
该公司正在推出两款 Beta 产品:一个是 API,暴露完整的 1200 万 Token 的窗口和 SubQ Code;一个基于同一模型构建的 CLI 代理。两者都在 neoclouds 上运行,而不是在主要的超大规模云服务提供商那里——首席执行官 Justin Dangel 说,“那非常昂贵”。
该公司不会开源权重,但计划为企业提供免费培训工具,方便他们自己进行岗位培训。5000 万 Token 的上下文窗口预计将在第四季度推出。
然而,这里有一个警示性的故事。Magic.dev 在 2024 年 8 月宣布了一个 1 亿 Token 的上下文窗口模型,
融资
迄今为止,Subquadratic 已经筹集了 2900 万美元,估值为 5 亿美元,投资者包括前软银愿景基金合伙人 Javier Villamizar 和 Tinder 联合创始人 Justin Mateen。该公司之前名为
声明:本文为 InfoQ 翻译,未经许可禁止转载。