OpenAI今日宣布计划为ChatGPT配备新的安全功能,使其能够在用户遭遇心理或情感困扰时做出更有帮助的响应。
首次即将推出的更新将专注于GPT-5的路由器组件,这是驱动ChatGPT的人工智能系统。路由器会分析每个用户提示,并自动确定OpenAI的哪个大语言模型最适合处理该请求。用户也可以手动指定应使用的大语言模型。
OpenAI将发布路由器的升级版本,该版本能够检测用户何时遭遇急性困扰,并将提示发送到推理优化的大语言模型。OpenAI员工在博客文章中写道,此类大语言模型比驱动ChatGPT的其他模型提供"更有帮助和有益的响应"。即使用户最初选择了较不先进的算法,路由器也会选择推理优化的大语言模型。
该公司计划"很快"发布升级版路由器。此外,它还将引入家长控制功能,旨在为青少年提供更强的内容保护。后者更新预计在下个月内推出。
家长将能够通过验证邮件将其ChatGPT账户与青少年的账户关联。从那里,家长将获得设置适合年龄的模型行为规则的能力,并禁用某些ChatGPT功能,如聊天历史记录。此外,OpenAI计划生成关于潜在有害提示的警报。
OpenAI解释说,ChatGPT将发送"当系统检测到他们的青少年处于急性困扰时刻的通知"。"专家意见将指导此功能,以支持家长和青少年之间的信任。"
OpenAI计划从由青少年发展、心理健康和人机交互专家组成的委员会获取专家意见。这家AI提供商今天表示,这些专家将帮助其开发ChatGPT家长控制功能的未来升级。
据OpenAI称,该委员会将与第二组专家合作,后者被称为全球医师网络。它包括250多名医疗专业人员,包括精神科医生、儿科医生和全科医生。OpenAI已经与这些医生在多个研究项目上合作。
"他们的意见直接影响我们的安全研究、模型训练和其他干预措施,帮助我们在需要时快速联系合适的专家,"OpenAI员工写道。"我们正在向我们的网络中添加更多临床医生和研究人员,包括那些在饮食失调、物质使用和青少年健康等领域具有深厚专业知识的人。"
今天宣布的举措是OpenAI上个月首次详述的更广泛AI安全推进的一部分。当时,这家大语言模型开发者表示,其研究人员还将使ChatGPT更好地检测长时间聊天会话中心理和情感困扰的迹象。此外,OpenAI将增强其用于阻止潜在有害提示响应的防护措施。
Q&A
Q1:OpenAI为ChatGPT新增的安全功能主要解决什么问题?
A:主要解决用户心理和情感困扰问题。新功能能够检测用户何时遭遇急性困扰,并自动将请求路由到推理优化的大语言模型,提供更有帮助和有益的响应,同时为青少年用户提供更强的内容保护。
Q2:ChatGPT的家长控制功能具体有哪些?
A:家长可以通过验证邮件将账户与青少年账户关联,设置适合年龄的模型行为规则,禁用聊天历史记录等功能,接收潜在有害提示的警报,以及当系统检测到青少年处于急性困扰时刻时收到通知。
Q3:OpenAI如何确保这些安全功能的专业性?
A:OpenAI建立了由青少年发展、心理健康和人机交互专家组成的委员会,以及包含250多名医疗专业人员的全球医师网络,包括精神科医生、儿科医生等,这些专家的意见直接影响安全研究和模型训练。
好文章,需要你的鼓励
穆拉蒂时隔18个月首次接受重大媒体采访,介绍其创立的Thinking Machines Lab正在开发的"交互模型"。该模型能以200毫秒间隔处理音频、文本和视频流,捕捉人类交流中的中断、修正和停顿。她还谈及OpenAI"政变周"经历,强调行业决策权过于集中的担忧,并回应了公司近期研究人员离职问题,表示这是初创实验室的正常波动。
STATE16研究院这篇综述发现,物理AI系统存在"静默失效"风险——AI以高度自信执行基于错误世界信息的动作,却不触发任何报警,并提出在AI输出与物理执行之间建立独立授权层的框架。
本期《Quick Charge》播客涵盖多个热点话题:特斯拉疑似试图删除FSD欺诈相关证据以规避巨额赔付;卡特彼勒持续推进建筑领域电气化布局;住宅太阳能30%税收抵免即将到期。此外,嘉宾Tom Pacheco就高压系统与电池技术培训展开探讨,强调电动车技术人才培养的紧迫性。节目同时提醒有意安装太阳能的用户尽快行动,可通过EnergySage平台比较多家安装商报价。
UIUC与微软联合研发的OpenWebRL框架让4B小模型仅凭400条初始数据,通过在真实网站上边做边学的强化学习方式,在网页智能体基准上超越了用27万条数据训练的竞争对手。