随着一些预测显示多模态人工智能市场在未来几年将以每年超过 35% 的速度增长,Google LLC 正在努力争取领先地位。
该公司的云计算部门最近表示,将文本、图像、视频、音频和其他非结构化数据与生成式 AI 处理相结合的多模态 AI,将成为 2025 年五大 AI 趋势之一。
Google 数据、分析和 AI 产品战略及对外产品管理执行官 Yasmeen Ahmad 表示,BigQuery 是 Google 多模态 AI 战略的核心,该公司正将这个数据仓库重新定位为可以收集和分析多种数据类型的数据湖仓。
她说:"在'数据湖仓'这个术语出现之前,BigQuery 就是最初的数据湖仓。我们构建了一个关系型引擎来支持企业客户想要进行的所有结构化分析。"
在接受 SiliconANGLE 采访时,Ahmad 表示,Google 估计 90% 的企业数据是非结构化的。通过将图像和语音识别等技术与结构化数据相结合进行检索增强生成训练,组织可以从以前无法使用的数据中获取洞察。
快餐连锁店 Wendy's 就是其中之一。它正在测试一个结合了 BigQuery、Google 的 Vision AI 和 Gemini 的应用程序,分析得来速服务车流量的视频以识别瓶颈。将观察到的视频图像数据与员工配置和排班信息相结合,以优化人员配置水平。Ahmad 说:"这不仅仅是视频分析,视频数据与运营数据在一个统一的平台中并存。"
United Parcel Service Inc. 构建了一个仪表板,利用卡车上安装的传感器数据,通过实时向驾驶员发出具体指令来优化实时配送路线。Bell Canada 正在使用 AI 生成的客服中心通话记录来训练一个教练助手,为客服人员提供反馈。
多模态 AI 可以使零售商从呼叫中心、社交媒体评论和移动应用反馈等多个来源收集客户情绪,并将其输入生成式 AI 引擎,以发现新的目标营销活动细分市场。Ahmad 说:"多模态数据和 AI 的这种组合实现了以前无法达到的个性化和可扩展性水平。"
Gemini 可以直接在 BigQuery 的数据基础上运行,无需数据传输。这加快了应用程序开发速度。Ahmad 表示,许多组织现在能够在几周内推出试点项目。
由于组织对向客户开放生成式 AI 持谨慎态度,大多数早期应用都是内部使用。但在防火墙后面仍有大量机会,Ahmad 说:"最容易实现的是那些客户长期收集了大量数据但一直无法利用的场景。有了 BigQuery 的多模态数据基础、Vision AI 和 Gemini 的集成,很容易就能实现应用。"
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。