谷歌周四表示,正在通过其Gemini应用为Veo 3 AI视频生成器增加图像转视频生成功能。
该公司此前已在其AI驱动的视频工具Flow中推出了这项功能,Flow于5月在谷歌I/O开发者大会上首次发布。
在5月推出基于Veo 3的视频生成功能后,截至上周,谷歌已在150多个国家提供该功能。目前,只有Google AI Ultra和Google AI Pro计划用户可以生成视频,每天限制三次创作且不可累积。
谷歌表示,用户可以通过在提示框的工具菜单中选择"视频"选项并上传照片来生成视频片段。用户还可以通过在提示中描述音频来添加声音。视频生成后,可以下载或与他人分享。
该公司指出,自7周前发布以来,用户已通过Gemini应用和Flow工具创建了超过4000万个视频。所有使用Veo 3模型生成的视频都会带有显示"Veo"的可见水印,以及不可见的SynthID数字水印,这是谷歌AI工具用来识别AI生成数字内容的技术。
今年早些时候,该公司还发布了一个帮助检测包含SynthID内容的工具。
好文章,需要你的鼓励
微软近年来频繁出现技术故障和服务中断,从Windows更新删除用户文件到Azure云服务因配置错误而崩溃,质量控制问题愈发突出。2014年公司大幅裁减测试团队后,采用敏捷开发模式替代传统测试方法,但结果并不理想。虽然Windows生态系统庞大复杂,某些问题在所难免,但Azure作为微软核心云服务,反复因配置变更导致客户服务中断,已不仅仅是质量控制问题,更是对公司技术能力的质疑。
Meta研究团队发现仅仅改变AI示例间的分隔符号就能导致模型性能产生高达45%的巨大差异,甚至可以操纵AI排行榜排名。这个看似微不足道的格式选择问题普遍存在于所有主流AI模型中,包括最先进的GPT-4o,揭示了当前AI评测体系的根本性缺陷。研究提出通过明确说明分隔符类型等方法可以部分缓解这一问题。
当团队准备部署大语言模型时,面临开源与闭源的选择。专家讨论显示,美国在开源AI领域相对落后,而中国有更多开源模型。开源系统建立在信任基础上,需要开放数据、模型架构和参数。然而,即使是被称为"开源"的DeepSeek也并非完全开源。企业客户往往倾向于闭源系统,但开源权重模型仍能提供基础设施选择自由。AI主权成为国家安全考量,各国希望控制本地化AI发展命运。
香港中文大学研究团队开发出CALM训练框架和STORM模型,通过轻量化干预方式让40亿参数小模型在优化建模任务上达到6710亿参数大模型的性能。该方法保护模型原生推理能力,仅修改2.6%内容就实现显著提升,为AI优化建模应用大幅降低了技术门槛和成本。