谷歌周四表示,正在通过其Gemini应用为Veo 3 AI视频生成器增加图像转视频生成功能。
该公司此前已在其AI驱动的视频工具Flow中推出了这项功能,Flow于5月在谷歌I/O开发者大会上首次发布。
在5月推出基于Veo 3的视频生成功能后,截至上周,谷歌已在150多个国家提供该功能。目前,只有Google AI Ultra和Google AI Pro计划用户可以生成视频,每天限制三次创作且不可累积。
谷歌表示,用户可以通过在提示框的工具菜单中选择"视频"选项并上传照片来生成视频片段。用户还可以通过在提示中描述音频来添加声音。视频生成后,可以下载或与他人分享。
该公司指出,自7周前发布以来,用户已通过Gemini应用和Flow工具创建了超过4000万个视频。所有使用Veo 3模型生成的视频都会带有显示"Veo"的可见水印,以及不可见的SynthID数字水印,这是谷歌AI工具用来识别AI生成数字内容的技术。
今年早些时候,该公司还发布了一个帮助检测包含SynthID内容的工具。
好文章,需要你的鼓励
穆拉蒂时隔18个月首次接受重大媒体采访,介绍其创立的Thinking Machines Lab正在开发的"交互模型"。该模型能以200毫秒间隔处理音频、文本和视频流,捕捉人类交流中的中断、修正和停顿。她还谈及OpenAI"政变周"经历,强调行业决策权过于集中的担忧,并回应了公司近期研究人员离职问题,表示这是初创实验室的正常波动。
STATE16研究院这篇综述发现,物理AI系统存在"静默失效"风险——AI以高度自信执行基于错误世界信息的动作,却不触发任何报警,并提出在AI输出与物理执行之间建立独立授权层的框架。
本期《Quick Charge》播客涵盖多个热点话题:特斯拉疑似试图删除FSD欺诈相关证据以规避巨额赔付;卡特彼勒持续推进建筑领域电气化布局;住宅太阳能30%税收抵免即将到期。此外,嘉宾Tom Pacheco就高压系统与电池技术培训展开探讨,强调电动车技术人才培养的紧迫性。节目同时提醒有意安装太阳能的用户尽快行动,可通过EnergySage平台比较多家安装商报价。
UIUC与微软联合研发的OpenWebRL框架让4B小模型仅凭400条初始数据,通过在真实网站上边做边学的强化学习方式,在网页智能体基准上超越了用27万条数据训练的竞争对手。