Genie 是谷歌旗下一款通用世界模型,能够生成多样化的交互式虚拟环境。自发布以来,Genie 已成为研究领域的重要基础工具,不仅帮助智能体在复杂虚拟场景中学习与推理,还协助 Waymo 模拟高度逼真的道路行驶环境。
如今,谷歌迈出了重要一步——将 Genie 的生成能力与谷歌街景的真实世界影像相结合,使模型得以在现实世界中找到坐标锚点。这一能力的扩展,可以为 AI 智能体或机器人提供虚拟环境,让它们在其中导航并应对真实世界的复杂情况。
街景接地功能现已上线:让虚拟世界扎根于现实
谷歌今天正式在实验性原型项目 Project Genie 中推出全新的街景接地功能,同时将 Project Genie 的访问权限向全球更多用户开放。
通过此次升级,用户可以利用真实世界的街景影像,探索自己喜爱的地点,或对其进行创意改造。在 Project Genie 中创建虚拟世界时,用户现在可以选择以真实地点为基础。只需点击地图图钉,选择一处美国境内的地点,再搭配"沙漠沙丘"或"石器时代"等风格,然后描述自己的角色形象——可以是最喜欢的动物、漫画英雄,甚至是黏土怪物——Genie 便会将这些信息融合,创造出一个以街景真实影像为起点的奇幻世界。该功能由"地图影像接地"技术驱动,与开发者用于生成精美 AI 视觉内容的街景技术一脉相承。
举个例子:想看看旧金山金门大桥在海底的模样?选择"海洋世界"风格,即可化身潜水员,与成群的鱼儿在大桥周围遨游。又或者想一探德克萨斯州标志性的沃思堡牲畜围场在 1920 年代的风貌?选择"黑白电影"风格,便能沉浸在一个充满酒馆、老式汽车和贸易站的复古世界中。
目前,Project Genie 的街景功能已覆盖美国境内地点,后续计划逐步扩展至更多地区。
Project Genie 现向谷歌 AI Ultra 订阅用户开放
即日起,Project Genie(含全新街景功能)将向全球符合条件的谷歌 AI Ultra 订阅用户(每月 200 美元,18 岁及以上)逐步开放。
需要说明的是,Project Genie 目前仍是 Google Labs 旗下的实验性研究原型,谷歌团队正持续优化细节,提升画面的精准度与真实感。如需了解更多进展及当前限制,可访问谷歌官方网站获取详细信息。
Q&A
Q1:Project Genie 是什么?有什么用?
A:Project Genie 是谷歌旗下的通用世界模型实验性原型,能够生成多样化的交互式虚拟环境。它不仅是研究领域的基础工具,帮助 AI 智能体在复杂虚拟场景中学习与推理,还能协助 Waymo 模拟逼真的道路环境。最新升级后,它还能结合谷歌街景的真实影像,让用户探索真实地点或对其进行创意改造。
Q2:Project Genie 的街景接地功能怎么使用?
A:用户只需在 Project Genie 中点击地图图钉,选择一处美国境内的真实地点,再选择喜欢的世界风格(如"沙漠沙丘""海洋世界""黑白电影"等),并描述自己的角色形象,Genie 便会以街景真实影像为基础,生成一个充满想象力的虚拟世界。目前该功能覆盖美国境内地点,后续将扩展至更多区域。
Q3:Project Genie 向哪些用户开放?如何获取访问权限?
A:即日起,Project Genie 将逐步向全球符合条件的谷歌 AI Ultra 订阅用户开放,订阅费用为每月 200 美元,用户需年满 18 岁。Project Genie 目前仍是 Google Labs 旗下的实验性研究原型,谷歌团队正持续优化功能细节,提升画面精准度。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。