Anthropic于周二正式推出了其主流Sonnet系列的最新模型——Sonnet 5。
Anthropic将Sonnet 5定位为"迄今为止最具智能体能力的Sonnet模型",从基准测试表现来看,其性能已接近Opus 4.8,相比Sonnet 4.6也有显著提升。Anthropic特别指出,该模型在推理、工具调用、软件编程以及知识类任务上的表现大幅改善。
与此前部分Sonnet版本不同,Sonnet 5在性能上并未完全超越最新的Opus大模型,但已足够接近,可暂时作为Opus 4.8的更经济替代方案——毕竟Opus 5的发布应该不会太远。
Anthropic强调,Opus 4.8尤其在更高推理级别下仍能提供更高的准确率,同时也指出"Sonnet 5为开发者提供了价格更低且质量远超以往的选择"。
在最高额外推理级别下,Sonnet 5在OSWorld-Verified和智能体搜索BrowseComp基准测试上的表现,大致相当于Opus 4.8中高推理设置下的水平。但由于在同等推理级别下,Sonnet 5的运行成本实际上高于Opus 4.8,因此某些任务场景下Opus 4.8仍是更优选择。
就目前Anthropic公布的基准测试结果而言,Sonnet 5始终优于Sonnet 4.6。
不过,基准测试只能反映模型能力的一部分。模型行为同样影响用户体验,Anthropic表示,其测试人员注意到,新模型现在往往能完成更复杂的任务,而"此前的Sonnet版本往往会中途放弃"。
为进一步吸引开发者(同时可能释放部分Opus 4.8的运行资源),Anthropic为API用户提供限时入门价格:在8月31日之前,输入Token每百万Token费用为2美元,输出Token每百万Token费用为10美元。此后将恢复至此前Sonnet系列的标准定价,即输入/输出Token分别为每百万Token 3美元和15美元。
当被问及这是否是Anthropic首次推出入门定价时,一位公司发言人对媒体表示:"我们希望客户在迁移窗口期内,能以尽可能低的成本针对实际工作负载对Sonnet 5进行测试。"
目前,Anthropic还提高了Chat、Cowork和Claude Code用户的速率限制,以"适应更高努力级别下更多的Token使用量"。
在AI安全方面,Anthropic表示并未"刻意针对网络安全任务对Sonnet 5进行训练"。虽然该模型能够处理一些常规的网络安全任务,但其在相关测试中的表现远不及Opus 4.8。Anthropic仍为该模型保留了网络安全防护机制,但由于风险较低,相关限制并不像部分其他模型那样严格。
Anthropic明确指出,例如在尝试寻找Firefox 147漏洞时,"Sonnet 5始终未能开发出完整可用的利用程序,但其取得部分成功的概率略高于前代Sonnet 4.6"。
由此来看,Sonnet 5被监管机构限制流通的风险相当低。
Q&A
Q1:Sonnet 5和Opus 4.8相比,性能差距有多大?
A:Sonnet 5的性能已非常接近Opus 4.8,但并未完全超越。在最高额外推理级别下,Sonnet 5在OSWorld-Verified和BrowseComp基准测试中的表现,相当于Opus 4.8中高推理设置的水平。Anthropic指出,Opus 4.8在更高推理级别下仍能提供更高的准确率,因此某些高要求任务仍推荐使用Opus 4.8。
Q2:Sonnet 5的API定价是多少?
A:在2025年8月31日之前,Sonnet 5提供限时入门价格,输入Token为每百万Token 2美元,输出Token为每百万Token 10美元。此后将恢复标准定价,即输入/输出Token分别为每百万Token 3美元和15美元。
Q3:Sonnet 5在网络安全方面有哪些限制?
A:Anthropic表示未针对网络安全任务对Sonnet 5进行专项训练,其在网络安全测试中的表现远不及Opus 4.8。测试显示,Sonnet 5无法针对Firefox 147开发出完整可用的漏洞利用程序,但部分成功率略高于Sonnet 4.6。该模型保留了网络安全防护机制,但限制相对宽松。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。