Google DeepMind升级前沿AI安全框架，防范操控和抗关停风险

谷歌DeepMind发布第三版前沿安全框架，加强对强大AI系统的监管。新版本重点关注操控能力，并扩展安全审查以覆盖模型抵抗人类关机或控制的场景。框架新增有害操控关键能力级别，解决先进模型可能大规模影响人类信念和行为的问题。更新还加强了对错位和控制挑战的审查，要求在模型达到特定阈值时进行安全案例评估，确保在发布前充分识别和缓解潜在风险。

Alphabet旗下的Google DeepMind实验室今日发布了第三版前沿安全框架(Frontier Safety Framework)，旨在加强对强大人工智能系统的监管，防止这些系统在失控时可能带来的风险。

该框架第三版引入了对操控能力的新关注点，并将安全审查范围扩展到模型可能抵制人类关停或控制的场景。

更新内容的首要亮点是增加了DeepMind所称的"有害操控关键能力等级"。这一等级旨在应对先进模型可能在高风险情境下大规模影响或改变人类信念和行为的可能性。该能力建立在多年来对生成式AI中说服和操控机制的研究基础上，并正式确定了如何在模型达到关键阈值之前测量、监控和缓解此类风险。

更新后的框架还对不对齐和控制挑战给予了更严格的审查，即高能力系统在理论上可能抵制修改或关停的问题。

DeepMind现在要求不仅在外部部署之前进行安全案例审查，还要在模型达到特定关键能力等级阈值后的大规模内部推广中进行审查。这些审查旨在强制团队在发布前证明潜在风险已被充分识别、缓解并判断为可接受。

除了新的风险类别外，更新后的框架还完善了DeepMind定义和应用能力等级的方式。这些改进旨在清楚地区分常规运营关切与最严重的威胁，确保治理机制在正确的时间触发。

前沿安全框架强调，缓解措施必须在系统跨越危险边界之前主动应用，而不是仅在问题出现后被动应对。

Google DeepMind的Four Flynn、Helen King和Anca Dragan在博客文章中表示："我们前沿安全框架的最新更新体现了我们持续承诺，即采用科学和基于证据的方法来跟踪并领先于AI风险，因为能力正朝着通用人工智能发展。通过扩展我们的风险领域和加强风险评估流程，我们旨在确保变革性AI造福人类，同时最大限度地减少潜在危害。"

作者补充说，DeepMind预计前沿安全框架将随着新研究、部署经验和利益相关者反馈的积累而持续发展。

Q&A

Q1：Google DeepMind前沿安全框架第三版主要更新了什么？

A：第三版框架主要增加了对AI操控能力的关注，设立了"有害操控关键能力等级"，并扩展了安全审查范围，覆盖模型可能抵制人类关停或控制的场景。同时完善了能力等级的定义和应用方式。

Q2：什么是有害操控关键能力等级？

A：有害操控关键能力等级是DeepMind新增的安全评估标准，用于应对先进AI模型可能在高风险情境下大规模影响或改变人类信念和行为的风险。它建立在多年来对生成式AI中说服和操控机制的研究基础上。

Q3：前沿安全框架如何确保AI系统的安全性？

A：框架要求在模型外部部署前和达到特定能力阈值的大规模内部推广时都要进行安全案例审查。强调必须在系统跨越危险边界之前主动应用缓解措施，而不是问题出现后被动应对，确保潜在风险被充分识别和缓解。

来源：SiliconANGLE

0赞

好文章，需要你的鼓励

Google DeepMind升级前沿AI安全框架，防范操控和抗关停风险

来源：SiliconANGLE

2025

09/23

09:37

分享

点赞

WAIC2026 现场直击：开普勒顶流人气王，麒麟系列火爆出圈

面壁智能将密度定律带入具身智能

龙磁科技拟投3.58亿元扩建越南永磁铁氧体基地

首创一层Scale-up网络256卡全互联，摩尔线程MTT C256超节点为万卡及十万卡级集群夯实底座

从高血压诊疗入手，北京安贞医院让医疗大模型走出聊天框

西门子肖松：以场景为牵引，推动工业AI从单点实效迈向生产力跃迁

打造Token极致性价比 新华三震撼亮相2026世界人工智能大会

机器人管家系统上线！傅利叶携多款康养陪伴新品方案亮相WAIC 2026

赛那德“ 自主作业机器人天团” 登陆 WAIC：iLoabot-X+模型双升级，秀出具身场景落地硬实力

西门子Eigen工程智能体中国首发首展，荣获2026 WAIC SAIL之星奖

NVIDIA Cosmos 推动物理 AI 前沿发展

PPIO亮相WAIC 2026：发布智能模型网关，打造面向Agent时代的智能Token工厂

新墨西哥州批准1650亿美元AI数据中心项目

英伟达押注英特尔，CUDA护城河扩大，AI工厂重塑数据中心

OpenAI与英伟达千亿美元AI计划：能耗相当于10座核反应堆

DeepMind发布AI安全报告：警示"失调"AI的潜在威胁

AI蒸馏技术重塑数据中心经济模式

2026年AI发展八大趋势预测：智能体普及与合成内容危机

YouTube推出Made on YouTube大会新功能：Studio智能体检测与直播升级

英国与Palantir签署15亿英镑国防合作协议

Meta申请进入电力交易市场应对AI需求激增

基于Gemini驱动的Google Home应用体验首测

如果您非常迫切的想了解IT领域最新产品与技术信息，那么订阅至顶网技术邮件将是您的最佳途径之一

三一集团：数字化是必选项，AI是生存项

因湃电池 × 达索系统：如何共创出一套电池产业最佳实践

AI走进真实世界之后：安全、健康与产业的新命题

CES 2026

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点:

打造Token极致性价比新华三震撼亮相2026世界人工智能大会