在最近一期由 LinkedIn 联合创始人 Reid Hoffman 共同主持的 Possible 播客节目中,Google DeepMind 的 CEO Demis Hassabis 表示,Google 计划将其 Gemini AI 模型与 Veo 视频生成模型最终整合在一起,以提升前者对物理世界的理解能力。
Hassabis 说道:"我们从一开始就将 Gemini(我们的基础模型)设计为多模态的。我们这样做是因为我们对通用数字助手有一个愿景,这个助手能够在现实世界中真正帮助到你。"
AI 行业正在逐步向"全能"模型发展——这类模型能够理解和合成多种形式的媒体内容。Google 最新的 Gemini 模型可以生成音频、图像和文本,而 OpenAI 在 ChatGPT 中的默认模型也能原生创建图像——当然也包括吉卜力工作室风格的艺术作品。Amazon 也宣布计划在今年晚些时候推出一个"任意转换"模型。
这些全能模型需要大量的训练数据——包括图像、视频、音频、文本等。Hassabis 暗示 Veo 的视频数据主要来自 Google 旗下的 YouTube 平台。
Hassabis 表示:"基本上,通过观看大量的 YouTube 视频,Veo 2 可以理解世界的物理规律。"
Google 此前向 TechCrunch 表示,其模型"可能"会按照与 YouTube 创作者的协议,使用"部分" YouTube 内容进行训练。据报道,Google 去年部分扩展了其服务条款,以允许公司获取更多数据来训练其 AI 模型。
好文章,需要你的鼓励
OpenAI 宣布重大升级:ChatGPT 现可记忆用户全部历史对话,并据此调整回复。这项功能将使 ChatGPT 随时间更了解用户,提供个性化响应。新功能包括"引用保存的记忆"和"引用聊天历史",目前仅向付费用户开放。虽然提升了实用性,但也引发了隐私方面的担忧。
本文探讨了人工智能聊天机器人对人类情感和关系的潜在影响。作者指出,虽然AI可以模仿关怀,但缺乏真实情感,可能导致人们对亲密关系的期望发生改变。特别是对儿童来说,过度依赖AI可能阻碍情感发展。文章呼吁我们要警惕AI带来的长期影响,保持人际交往的真实性。
AI革命的下一波浪潮不仅仅关乎拥有AI技术,更在于拥有能让AI真正理解业务的人才。虽然媒体关注的是构建大语言模型和复杂AI代理的工程师,但在前瞻性公司的分析部门中,一场悄然革命正在酝酿:AI分析师的兴起。这个角色将成为连接AI技术与业务实践的关键纽带,对企业数字化转型至关重要。
Google 推出了 Firebase Studio,这是一个基于云的人工智能辅助开发环境。它结合了 Project IDX、GenKit 和 Gemini 等技术,旨在帮助开发者快速原型设计和构建应用程序。然而,一些开发者反馈称,目前该工具的 AI 功能还不够成熟,难以生成高质量的可用代码。这表明 AI 辅助开发工具虽有潜力,但仍无法完全取代专业开发人员的技能和经验。