Google 正将其 Veo 2 视频生成 AI 模型引入 Gemini Advanced 付费用户,这是该公司推出的高级 AI 服务计划。
此次扩展正值 Google 寻求推出 OpenAI 的 Sora 视频生成平台的对标产品之际,同时这一领域的竞争也日益激烈。两周前,一家颇具实力的合成媒体公司 Runway 发布了其第四代视频生成器,并筹集了超过 3 亿美元的新资金。
从本周二开始,Gemini Advanced 订阅用户可在 Google 的 Gemini 应用中从模型下拉菜单选择 Veo 2。用户可以生成 16:9 画幅、720p 分辨率的 8 秒视频剪辑,并通过 Gemini 的 “share” 按钮将这些剪辑上传至 TikTok、YouTube 等平台。由 Veo 2 生成的视频还可下载为 MP4 文件,并附加有 Google SynthID 技术的水印。
Google 表示,每月用户可生成的视频数量存在限制,而且目前 Google Workspace 商务和教育计划尚不支持该功能。
Google 还将 Veo 2 与 Whisk 集成,Whisk 是 Google Labs 中一项实验性功能,允许用户将图像作为提示,通过 Gemini 创造出新图像。新功能 Whisk Animate 使用户能够将生成的图像转换成 8 秒的 Veo 2 生成视频。(Google Labs 是 Google 为早期 AI 产品提供的平台,该平台通过公司每月 20 美元的 Google One AI Premium 订阅进行授权。)
目前来看,Google 对 Veo 2 的应用显得相对基础。不过,Google DeepMind 首席执行官 Demis Hassabis 最近表示,公司计划最终将 Gemini AI 模型与 Veo 相结合,以提升前者对物理世界的理解能力。
与此同时,许多艺术家和创作者对 Veo 2 这类视频生成器持谨慎态度,因为它可能颠覆整个创意产业。由好莱坞动画师与卡通画家工会 Animation Guild 委托的一项 2024 年研究估计,到 2026 年,基于美国的电影、电视和动画工作岗位中将有超过 10 万个因 AI 的应用而受到冲击。
好文章,需要你的鼓励
研究人员意外发现,标准MOSFET晶体管可同时模拟神经元和突触行为,形成"神经突触随机存取存储器"(NSRAM)。该技术仅需一至两个晶体管即可实现传统需数十乃至数百个元件才能完成的神经信号处理,且与现有硅基制造工艺完全兼容,良率达100%。未来有望应用于边缘AI及高能效神经形态芯片,长远或可挑战GPU地位。
论文对比了AI通过图形界面和命令行两种方式完成桌面任务的差异,发现两者各有瓶颈:GUI受限于视觉交互可靠性,命令行受限于技能库覆盖率。
本文提出一种评估人工智能风险的新方法,借鉴生态学与演化论视角,从理论生态模型中推导出三项风险指标,涵盖种群模型与生态系统模型。研究旨在为AI治理策略提供量化工具,并对分析局限性及政策改进方向进行了深入探讨,为构建更科学的AI风险评估体系提供参考框架。
复旦大学团队提出ICWM框架,让机器人在任务前通过随机探测动作自主感知当前视角和物理配置,无需重新训练即可适应新摄像头角度,真实机器人测试成功率最高提升175%。