AI
今年早些时候,Subquadratic公司宣布推出一款基于稀疏注意力机制的模型,支持1200万Token的上下文窗口,速度也远超当前主流大语言模型。但公司当时并未广泛发布该模型,也未公开任何基准测试数据,这引发了业界不少质疑。
直到今年6月,Subquadratic才正式发布了首张模型卡和小型模型SubQ 1.1的基准测试结果,同时引入了数据公司Appen提供的第三方验证,并开始披露首批设计合作伙伴的相关信息,这些合作伙伴已获得模型访问权限。不过目前真正使用过该模型的人依然寥寥无几。为此,The New Stack与Subquadratic联合创始人兼首席技术官Alex Whedon进行了深度对话。
不只是稀疏注意力公司
Whedon首先纠正了一个常见的误解:"我们并不是一家稀疏注意力公司。我们已经在研究非注意力架构相当长一段时间了。我们认为,在下一代模型架构上,我们将是第一个实现自我超越的团队。"
SubQ 1.1小型模型建立在Subquadratic稀疏注意力机制(SSA)之上。该机制的核心特点是:上下文长度的计算量近似线性增长,而非传统的二次方增长。
Whedon解释道:"在全注意力矩阵中,1000个Token的输入会产生近百万种两两Token关系,这正是二次方增长规律的根源。而SSA的核心理念是,并非所有Token关系都重要。"
在长上下文检索能力方面,SubQ 1.1小型模型表现突出。在"大海捞针"测试中,该模型在从100万到1200万Token的范围内均取得了接近满分的成绩,尽管其训练主要集中在100万Token。在英伟达更高难度的RULER测试中(要求模型在128000个Token的上下文中追踪并汇总多个事实,而非仅定位单一信息),SubQ 1.1取得了99.12%的高分。
在通用能力方面,该模型的表现略低于中高端前沿模型:GPQA Diamond得分为85.4,而Sonnet 4.6为87.5;在LiveCodeBench编程基准测试中,SubQ 1.1得分为89.7,低于Opus 4.8和GPT-5.5,但略优于Sonnet 4.6。
效率方面是该模型最大的亮点。公司表示,在100万Token的输入下,SubQ的计算量比密集注意力机制减少64.5倍,在单一注意力层上比FlashAttention-2快56倍;在完整的1200万Token窗口下,注意力计算量的削减幅度接近1000倍。
"Transformer本质上是一种对文本建模问题的暴力求解方式,"Whedon说,"它把每一个Token与所有其他Token进行比较,这非常粗暴,也非常原始——它默认第一个Token需要与第二个、第三个、第50个乃至第5000个Token都产生关联。这并不是人类阅读文本的方式。"
他同时强调,SSA与检索增强生成(RAG)不同:RAG在模型处理之前就会丢弃部分文本块,而在SSA机制下,"模型会看到文本中的每一个Token,只是不会对每对Token进行冗余比较而已"。
面向企业的差异化定位
在市场定位上,Subquadratic将企业客户视为核心目标群体。"我们看到很多企业在大规模数据处理任务上倾向于使用中端模型而非前沿模型,这正是我们希望切入的场景,"Whedon表示。
1200万Token的超长上下文窗口意味着可以一次性处理大量文档。与当前许多模型在上下文窗口填满之前就性能下滑不同,SubQ凭借近乎完美的检索得分,可能是企业大规模数据处理场景的理想选择。
目前,模型访问权限仅开放给设计合作伙伴,"这些合作伙伴大多是企业客户,其年度支出规模大多在亿级以上,"Whedon透露,"这是我们从第一天起就非常重视的核心市场。"面向个人用户的限量访问将在正式全面开放之前推出。
关于此前发布时未附带基准测试数据的问题,Whedon坦言:"我们当时发布的主要是研究成果,发布方式的措辞或许可以有所不同,内部对此也有过讨论。"
谁是原始底座模型?
一个悬而未决的问题依然存在。模型卡显示,Subquadratic"从一个现有的开放权重前沿模型出发,将其密集注意力替换为稀疏注意力机制(SSA)",随后在书籍、文档和代码库等数据上进行了约一万亿Token的长上下文持续预训练。
这一表述印证了部分质疑者在发布之初的猜测——OpenAI研究员Will Depue曾写道,SubQ"几乎可以肯定是Kimi或DeepSeek的稀疏注意力微调版本"。因此,该模型真正的创新在于SSA机制和长上下文训练方案,而非从头训练的全新模型。Subquadratic至今未披露所使用的具体开放权重底座模型。
Whedon表示,在长上下文检索方面,影响最大的因素是在超长序列上进行预训练,而SSA的高效率使这一流程的成本足够低廉,得以常规化执行。"没有人在讨论数百万Token的预训练,"他说。
"零注意力":超越稀疏注意力的下一步
在稀疏注意力之外,Subquadratic正在研究他所称的"零注意力"架构——彻底抛弃注意力机制。
Whedon认为,现有的混合架构方案只走了"一半路"。无论是英伟达基于Mamba的Nemotron、Qwen的Gated DeltaNet,还是各类线性保留设计,都只是替换了部分注意力层。"如果80%的层不再是二次方增长,那么在无限扩展的情况下,最多也只能获得约5倍的收益,"他说,"而我们在100万Token时实现了60倍提升,在1200万Token时接近1000倍。这种量级的收益只有在真正改变了扩展规律的前提下才能实现,而不是单纯的常数系数优化。"
他对注意力机制本身的局限性有更深层的思考:"注意力机制在某种程度上类似于RAG,Token都被表示为查询、键和值——信息存储在一个个离散的小盒子里。这固然便于构建暴力求解方案,但也限制了信息压缩的能力。如果采用更连续、更抽象的信息表示方式,就能实现更高的压缩率,进而构建更小的模型,或者在同等规模下实现更大的智能跃升。"
他表示,这一方向的灵感来自世界模型研究,以及Yann LeCun的相关工作:"我们在重新思考如何表示长距离依赖关系、如何维持长程状态、如何重新设计目标函数——这大概是我目前能透露的全部了。"
Whedon还提到,公司目前对外公开的只有三类效率目标(计算效率、样本效率和内存效率)中的第一类,其余两类的进展尚未对外披露。
下一步计划
关于公司的近期规划,Whedon保持务实:"从长远来看,我们确实希望在原始质量上与OpenAI和Anthropic竞争。但短期内,我们必须有所取舍。如果我们试图用远少于对手的资本去做所有事情,结果不会好看。"
下一款模型预计将是中等规模(类似SubQ 1.2 Medium),他预期该模型将在同一档次中超越大多数竞争对手。至于模型的具体上市方式,Whedon未作明确表态——不排除通过某家超大规模云服务商的大型模型平台进行发布。值得注意的是,Whedon本人常驻迈阿密,而此次采访地点选在旧金山,或许也在一定程度上透露了团队目前的动向。
Q&A
Q1:SubQ 1.1模型的Subquadratic稀疏注意力机制(SSA)与传统Transformer的全注意力机制有什么区别?
A:传统Transformer会将每个Token与所有其他Token进行两两比较,计算量随上下文长度呈二次方增长。SSA的核心逻辑是"并非所有Token关系都重要",通过只计算真正重要的Token关系,将计算量的增长趋近于线性。公司数据显示,在100万Token下,SSA比密集注意力减少64.5倍计算量,在1200万Token下计算量削减接近1000倍,同时在长上下文检索基准测试中保持近乎完美的准确率。
Q2:SubQ 1.1的通用能力表现如何,能否与Claude Sonnet或GPT系列相比?
A:SubQ 1.1小型模型的通用能力大致处于中高端前沿模型的水平附近:在GPQA Diamond测试中得分85.4(Sonnet 4.6为87.5),在LiveCodeBench编程基准中得分89.7,略优于Sonnet 4.6但低于Opus 4.8和GPT-5.5。该模型的核心优势不在于通用能力排名,而在于以更小的参数规模(低于1000亿参数)和更低的计算成本,在长上下文检索场景中实现接近顶级模型的表现。
Q3:Subquadratic研究的"零注意力"架构是什么概念?
A:"零注意力"是Subquadratic正在研究的下一代模型架构方向,核心思路是彻底放弃注意力机制。Whedon认为,注意力机制将Token信息存储在离散的查询、键、值结构中,限制了信息压缩能力。"零注意力"架构试图采用更连续、更抽象的信息表示方式,以实现更高的压缩率,从而用更小的模型规模达到更高的智能水平。该方向的灵感部分来源于Yann LeCun的世界模型研究,目前具体细节尚未对外披露。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。