OpenAI最新发布的GPT-5.3-Codex-Spark模型标志着该公司Codex软件开发模型系列的一次重要转变,其核心优势聚焦于大幅降低响应延迟。
这款模型基于Cerebras公司125千万亿次浮点运算的晶圆级引擎3芯片,专门针对延迟性能与智能程度同等重要甚至更为关键的应用场景设计。在速度表现上,Codex Spark能够实现每秒超过1000个Token的处理能力。
几天前OpenAI发布GPT-5.3-Codex时,重点强调了团队成功将延迟降低25%的成就。然而,虽然标准版模型在长时间编程和智能体任务方面表现出色(这些场景对延迟要求相对较低),但Codex Spark则专门为快速原型开发和即时答案获取而优化设计。
核心设计理念在于提供两个互补的模型:一个高速版本用于实时协作,一个相对较慢的版本处理需要深度推理的长时间运行任务。
OpenAI指出,新模型最适合对代码进行小规模、高度精准的编辑操作。速度优势还带来另一个显著好处:模型可以轻松被中断和重新定向,从而帮助开发者快速迭代。
然而,由于针对特定使用场景进行优化,该模型在发布时仅提供128,000个Token的上下文窗口,并且只支持文本输入。随着时间推移,团队计划为这个高速模型系列增加更多功能,包括更大规模的模型、更长的上下文长度以及多模态输入支持。
公司坦承新模型的性能将不如GPT-5.3-Codex,"但能够在极短时间内完成任务"。
在标准SWE-Bench Pro基准测试中,Codex Spark的得分确实显著低于GPT-5.3-Codex,但它能够更快速地达到可用结果,这对许多应用场景来说可能已经足够。
在Terminal-Bench 2.0测试中(该测试评估模型在终端智能体工作流程中的表现),它的得分也明显低于更大规模的GPT-5.3-Codex(58.4%对比77.3%)。
GPT-5.3-Codex-Spark层级目前作为研究预览版向ChatGPT Pro用户开放,可通过命令行界面、VS Code和Codex应用程序使用(该应用下载量已超过100万次)。部分OpenAI合作伙伴也将通过API获得Codex Spark的早期访问权限。
OpenAI提醒,新Codex Spark模型的容量可能受到限制,可能出现访问速度较慢和临时排队的情况。该模型将有自己的速率限制,使用它不会计入公司的常规速率限制。
由于尚未通过API提供,OpenAI暂未公布任何定价信息。
使用不同模型层级的概念并非全新想法。Anthropic凭借其三层级模型(Haiku、Sonnet和Opus),以及其他公司长期采用类似方法,主要通过智能程度、速度和定价来区分模型。OpenAI本身也长期提供其模型的精简版本。
主要区别在于,OpenAI还为这个新模型采用了完全不同的硬件平台。
OpenAI选择在Cerebras硬件上运行这个模型绝非偶然。2026年初,两家公司宣布了一项据报道价值高达100亿美元的多年合作协议。根据该协议,Cerebras将建设和托管数据中心,为OpenAI提供750兆瓦的容量来运行其晶圆级芯片。
与大多数标准GPU和AI加速器相比,Cerebras的芯片规模庞大。英伟达旗舰Blackwell B200加速器拥有2080亿个晶体管,而Cerebras芯片拥有4万亿个晶体管,分布在近90万个核心中。
但这不仅仅是纯粹的计算能力。目前,推理的真正瓶颈不是计算而是内存带宽。Cerebras承诺通过使用片上内存和高达每秒27PB的内部带宽来消除这一瓶颈。
在公告中,OpenAI强调GPU仍然是其训练和推理管道的基础。但公司也指出,"Cerebras通过在要求极低延迟的工作流程中表现出色来补充这一基础,收紧端到端循环,使Codex在迭代时感觉更加响应迅速"。
正如Cerebras首席技术官兼联合创始人Sean Lie所说:"GPT-5.3-Codex Spark最让我们兴奋的是与OpenAI和开发者社区合作,探索快速推理的可能性——新的交互模式、新的用例以及根本不同的模型体验。这个预览版只是开始。"
Q&A
Q1:Codex Spark与标准GPT-5.3-Codex有什么区别?
A:Codex Spark专门针对速度优化,能够实现每秒超过1000个Token的处理能力,主要用于快速原型开发和即时答案获取。虽然性能不如GPT-5.3-Codex,但能在极短时间内完成任务,特别适合需要快速响应的场景。
Q2:为什么OpenAI选择使用Cerebras硬件运行Codex Spark?
A:Cerebras芯片拥有4万亿个晶体管和近90万个核心,相比英伟达Blackwell B200的2080亿晶体管规模庞大。更重要的是,它通过片上内存和高达每秒27PB的内部带宽解决了推理过程中的内存带宽瓶颈问题。
Q3:普通用户如何使用Codex Spark模型?
A:目前GPT-5.3-Codex-Spark作为研究预览版向ChatGPT Pro用户开放,可通过命令行界面、VS Code和Codex应用程序使用。由于容量限制,可能出现访问速度较慢和排队情况,且尚未通过API提供,暂无定价信息。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。