OpenAI 推出 o3-pro,这是一款公司宣称迄今为止最强大的 AI 模型。
o3-pro 是 OpenAI 今年早些时候推出的 o3 推理模型的一个版本。与传统 AI 模型不同,推理模型能够分步解决问题,使其在物理、数学和编码等领域表现得更加稳定可靠。
OpenAI 表示,从本周二开始,o3-pro 将面向 ChatGPT Pro 和 Team 用户提供服务,并取代目前的 o1-pro 模型。企业和教育用户将在下周获得访问权限。o3-pro 今下午也已在 OpenAI 的开发者 API 中上线。
在 API 中,o3-pro 的定价为每百万输入 Token 收费 20 美元,每百万输出 Token 收费 80 美元。输入 Token 指送入模型的 Token,而输出 Token 指模型根据输入生成的 Token。
一百万个输入 Token 相当于大约 750,000 个单词,这比《战争与和平》略长。
OpenAI 在更新日志中写道:“在专家评估中,评审员在每个测试类别中均一致偏好 o3-pro,相比 o3 在科学、教育、编程、商务和写作协助等关键领域尤为突出。评审员还对 o3-pro 在清晰度、全面性、指令响应和准确性方面的一致高分给予认可。”
根据 OpenAI 的介绍,o3-pro 拥有使用工具的能力,能够进行网络搜索、文件分析、对视觉输入进行推理、使用 Python、利用内存个性化其响应等功能。不过,OpenAI 指出,由于这些功能,o3-pro 的响应通常需要比 o1-pro 更长的时间来完成。
o3-pro 也存在一些限制。目前,由于 OpenAI 正在解决一项“技术问题”,在 ChatGPT 中与该模型进行临时聊天的功能被禁用。o3-pro 不能生成图像,并且 OpenAI 的 AI 驱动工作区功能 Canvas 与 o3-pro 不兼容。
值得一提的是,根据 OpenAI 的内部测试,o3-pro 在流行的 AI 基准测试中取得了令人印象深刻的分数。在评估模型数学能力的 AIME 2024 测试中,o3-pro 的得分超过了 Google 表现最好的 AI 模型 Gemini 2.5 Pro。在 GPQA Diamond—一项针对博士级科学知识的测试中,o3-pro 也击败了 Anthropic 最近发布的 Claude 4 Opus。
好文章,需要你的鼓励
很多人担心被AI取代,陷入无意义感。按照杨元庆的思路,其实无论是模型的打造者,还是模型的使用者,都不该把AI放在人的对立面。
这项由清华大学和字节跳动联合开展的研究首次实现了高保真视频换脸技术的重大突破。DreamID-V框架通过创新的身份锚定视频合成器和多模态条件注入机制,成功解决了传统视频换脸技术中身份相似度低、时间不连贯等核心问题,在保持原视频动作表情的同时实现完美的身份替换,为影视制作、创意设计等领域带来革命性变化。
谷歌宣布对Gmail进行重大升级,全面集成Gemini AI功能,将其转变为"个人主动式收件箱助手"。新功能包括AI收件箱视图,可按优先级自动分组邮件;"帮我快速了解"功能提供邮件活动摘要;扩展"帮我写邮件"工具至所有用户;支持复杂问题查询如"我的航班何时降落"。部分功能免费提供,高级功能需付费订阅。谷歌强调用户数据安全,邮件内容不会用于训练公共AI模型。
阿尔伯塔大学研究团队开发出名为Gnosis的AI自我检查系统,能让人工智能实时监测自己的内部"思维状态",判断答案可靠性。该系统通过分析AI的隐藏状态和注意力模式,在数学推理任务中达到95%准确率,超越传统方法和大型审核模型,且仅需500万参数。更重要的是,它能在AI回答40%时就预测最终答案质量,支持早期错误检测,为构建更诚实可靠的AI系统开辟了新路径。