随着AI视频模型能力不断增强,YouTube不再仅仅依赖创作者自行标注AI视频,平台现在将自动代为标注。该公司周三宣布,其内部系统将在检测到使用了"重要的照片级真实感AI技术"时自动添加标签。
YouTube还将使AI标签更加醒目,让用户在长视频和YouTube Shorts短视频中都能更容易发现这些标注。
视频平台上的AI标签已使用超过两年。此前YouTube更新了AI政策,并在创作者工作室推出了一项工具,要求创作者披露其视频中包含可能被误认为真实人物、地点或事件的AI内容。那些明显描绘动画或想象场景的视频,比如独角兽在奇幻世界中跳跃,则无需标注。
该公司表示,其AI标注政策并未改变,但将在监管平台内容方面发挥更积极的作用。此举正值谷歌在上周的Google I/O开发者大会上发布Gemini Omni之后,这是一个新的多模态AI模型家族,能够输出高质量视频,展现对物理、文化、历史和科学的理解。
从5月开始,YouTube将使用新的内部信号来帮助识别AI生成的内容并相应标注。这并不意味着创作者不应继续披露其AI使用情况,但如果他们忽略了这一点,YouTube将代为标注视频。
虽然内容被误判的创作者可以在YouTube视频中更新披露状态,但如果内容是使用YouTube自己的AI工具(如Veo或Dream Screen)创建的,他们将无法删除这些标签。
当内容包含C2PA元数据表明其完全由AI生成时,标签也将永久附加到视频上。最近,OpenAI承诺采用C2PA标准,加入了英伟达、Kakao和Eleven Labs的行列。
自动AI检测功能的增加紧随YouTube AI深度伪造检测功能的扩展,该功能现在允许任何成年人专门扫描YouTube进行面部匹配,此前已在名人、公众人物、政治家和其他创作者中进行了初步测试。
YouTube表示还将使其AI标签更加一致和醒目。
此前,标签会出现在展开的描述中,除非视频涉及健康或新闻等更敏感的话题,在这种情况下,醒目的标签会直接出现在视频本身上。
现在,对于长视频,标签将直接显示在视频播放器下方、描述上方;对于YouTube Shorts短视频,标签将直接叠加显示在视频上。
该公司表示,移动标签位置将使人们在网站上遇到照片级真实感、AI修改或AI生成的内容时更容易注意到。
同时,对于仅轻微修改、动画化或不真实的AI视频,比如前面提到的跳跃独角兽,标签将仅出现在展开的描述中。
值得注意的是,YouTube表示AI标签不会影响视频的推荐方式或其变现能力。
除了监管AI内容外,该公司还一直在AI领域投资,包括互动搜索功能Ask YouTube、YouTube Music的播放列表生成器、AI视频摘要以及其他生成式AI创作工具。
Q&A
Q1:YouTube为什么要自动标注AI视频?
A:随着AI视频模型能力不断增强,YouTube不再仅依赖创作者自行标注,而是通过内部系统自动检测使用了"重要的照片级真实感AI技术"的视频并添加标签,以更积极地监管平台内容,帮助用户识别AI生成或修改的内容。
Q2:YouTube的AI标签会显示在什么位置?
A:对于长视频,AI标签将直接显示在视频播放器下方、描述上方;对于YouTube Shorts短视频,标签将直接叠加显示在视频上。仅轻微修改或不真实的AI视频标签则只出现在展开的描述中。
Q3:AI标签会影响视频推荐和收益吗?
A:不会。YouTube明确表示,AI标签不会影响视频的推荐方式或其变现能力,标签的目的仅是帮助用户识别AI生成或修改的内容。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。