OpenAI 宣布为 ChatGPT 推出一项名为"深度研究"的新型"代理"功能,使其能够代表用户进行深入复杂的研究工作。
该公司在周日发布的博客文章中介绍了这项新功能。文章指出,该功能可以自主运行,规划并执行多步骤流程来查找用户所需的信息。OpenAI 表示,它能够在必要时"回溯并对实时信息作出反应"。
当用户使用深度研究功能进行调查时,他们得到的不仅仅是一个简单的文本答案。相反,ChatGPT 会在侧边栏显示其研究过程的摘要,并附带引用来源的研究发现。
用户可以使用简单的文本提问,并上传图像和其他文件(如 PDF 和电子表格)来提供背景信息。ChatGPT 将花费 5 到 30 分钟生成全面的回应。该公司表示,未来它还将能够在回应中嵌入图表和图像。
OpenAI 表示,ChatGPT 深度研究就像拥有一位专业的人类研究员,但同时警告说 AI 仍可能犯错。风险包括编造事实、难以区分谣言和权威信息,以及对某些回应进行评级。
该公司正试图通过使用新发布的"推理"模型 o3-mini 的专门版本来限制这些"幻觉"。该模型通过强化学习技术进行训练,使用浏览器和 Python 工具执行实际任务。
强化学习是一种使 AI 模型通过试错来学习实现特定目标的最佳方式的技术。当模型越接近目标时,它会获得虚拟奖励,从而激励它更高效地完成任务。
据 OpenAI 介绍,用于深度研究的 o3 版本已针对网络浏览和数据分析任务进行了优化。该公司解释说,该模型运用其推理能力来搜索、解释和分析互联网上海量的文本、图像和其他数据,并根据分析结果及时调整。
ChatGPT 深度研究属于"代理 AI",这是指能够在最少人工监督的情况下代表人类执行复杂多步骤任务的更高级 AI 工具。代理 AI 的理念是通过接管人类工作者不愿意自己做的重复性和繁琐任务来提高生产力。这项新功能是继 Operator(一个使用网络浏览器完成诸如查找和预订酒店房间等任务的工具)之后的又一发展。
OpenAI 在其博客文章中通过嵌入的视频展示了深度研究的功能,展示了关于零售业在过去三年中如何变化的信息请求。它提供了包含各种要点和表格的详细回应。
它还通过一个名为"人类的最后考试"的 AI 基准测试来运行深度研究,该测试评估 AI 模型回答"专家级问题"的能力。OpenAI 表示,它以 26.6% 的准确率创下新纪录,远超 ChatGPT 的 3.3% 和 o3-mini (high) 模型的 13%。
该公司表示,深度研究功能现已向 ChatGPT Pro 用户开放,每月支付 200 美元订阅费的用户可进行多达 100 次查询。该公司还承诺在未来几周内向 ChatGPT Plus、Team 和 Enterprise 用户提供"有限访问"权限。
该公司未提及向免费用户开放深度研究功能,这可能是因为该模型"计算资源消耗极大"。
好文章,需要你的鼓励
香港中文大学与华为诺亚方舟实验室合作开发了PreMoe框架,解决了大型混合专家模型(MoE)在内存受限设备上的部署难题。研究团队发现MoE模型中的专家表现出明显的任务专业化特征,据此提出了概率专家精简(PEP)和任务自适应专家检索(TAER)两大核心技术。实验证明,DeepSeek-R1 671B模型在精简50%专家后仍保持97.2%的MATH500准确率,内存需求降至688GB;而更激进的精简方案(减少87.5%专家)也能保持72.0%的准确率。该方法适用于多种MoE架构,为强大AI系统的广泛部署铺平了道路。
SCIENCEBOARD是一项开创性研究,旨在评估多模态自主智能体在真实科学工作流中的表现。研究团队构建了一个包含169个高质量任务的基准测试,涵盖生物化学、天文学等六个科学领域,并开发了一个真实环境让智能体通过CLI或GUI接口与科学软件交互。实验评估表明,即使是最先进的模型在这些复杂科学任务上的成功率也仅为15%,远低于人类表现,揭示了当前技术的局限性并为未来科学智能体的发展提供了宝贵见解。
帝国理工学院的研究团队开发了AlphaMed,这是首个仅通过极简规则强化学习就能培养医疗推理能力的AI模型,无需依赖传统的思维链示范数据。通过分析数据信息丰富度和难度分布的影响,研究发现高信息量的医疗问答数据是推理能力的关键驱动因素。AlphaMed在六个医疗问答基准上取得了领先成绩,甚至超越了更大的封闭源模型,同时展现出自发的步骤推理能力,为医疗AI发展提供了更加开放、高效的新路径。
Alita是一种新型通用AI代理系统,采用极简设计理念,以"最小预定义,最大自我进化"为原则构建。由普林斯顿大学等多家机构研究团队开发的Alita,只配备一个核心能力和少量通用模块,能自主创建所需工具并重用为模型上下文协议(MCPs)。实验显示,Alita在GAIA基准测试上达到87.27%的通过率,超越包括OpenAI Deep Research在内的复杂系统,证明简约设计可带来卓越性能。