随着一些预测显示多模态人工智能市场在未来几年将以每年超过 35% 的速度增长,Google LLC 正在努力争取领先地位。
该公司的云计算部门最近表示,将文本、图像、视频、音频和其他非结构化数据与生成式 AI 处理相结合的多模态 AI,将成为 2025 年五大 AI 趋势之一。
Google 数据、分析和 AI 产品战略及对外产品管理执行官 Yasmeen Ahmad 表示,BigQuery 是 Google 多模态 AI 战略的核心,该公司正将这个数据仓库重新定位为可以收集和分析多种数据类型的数据湖仓。
她说:"在'数据湖仓'这个术语出现之前,BigQuery 就是最初的数据湖仓。我们构建了一个关系型引擎来支持企业客户想要进行的所有结构化分析。"
在接受 SiliconANGLE 采访时,Ahmad 表示,Google 估计 90% 的企业数据是非结构化的。通过将图像和语音识别等技术与结构化数据相结合进行检索增强生成训练,组织可以从以前无法使用的数据中获取洞察。
快餐连锁店 Wendy's 就是其中之一。它正在测试一个结合了 BigQuery、Google 的 Vision AI 和 Gemini 的应用程序,分析得来速服务车流量的视频以识别瓶颈。将观察到的视频图像数据与员工配置和排班信息相结合,以优化人员配置水平。Ahmad 说:"这不仅仅是视频分析,视频数据与运营数据在一个统一的平台中并存。"
United Parcel Service Inc. 构建了一个仪表板,利用卡车上安装的传感器数据,通过实时向驾驶员发出具体指令来优化实时配送路线。Bell Canada 正在使用 AI 生成的客服中心通话记录来训练一个教练助手,为客服人员提供反馈。
多模态 AI 可以使零售商从呼叫中心、社交媒体评论和移动应用反馈等多个来源收集客户情绪,并将其输入生成式 AI 引擎,以发现新的目标营销活动细分市场。Ahmad 说:"多模态数据和 AI 的这种组合实现了以前无法达到的个性化和可扩展性水平。"
Gemini 可以直接在 BigQuery 的数据基础上运行,无需数据传输。这加快了应用程序开发速度。Ahmad 表示,许多组织现在能够在几周内推出试点项目。
由于组织对向客户开放生成式 AI 持谨慎态度,大多数早期应用都是内部使用。但在防火墙后面仍有大量机会,Ahmad 说:"最容易实现的是那些客户长期收集了大量数据但一直无法利用的场景。有了 BigQuery 的多模态数据基础、Vision AI 和 Gemini 的集成,很容易就能实现应用。"
好文章,需要你的鼓励
在“PEC 2025 AI创新者大会暨第二届提示工程峰会”上,一场以“AIGC创作新范式——双脑智能时代:心智驱动的生产力变革”为主题的分论坛,成为现场最具张力的对话空间。
人民大学团队开发了Search-o1框架,让AI在推理时能像侦探一样边查资料边思考。系统通过检测不确定性词汇自动触发搜索,并用知识精炼模块从海量资料中提取关键信息无缝融入推理过程。在博士级科学问题测试中,该系统整体准确率达63.6%,在物理和生物领域甚至超越人类专家水平,为AI推理能力带来突破性提升。
Linux Mint团队计划加快发布周期,在未来几个月推出两个新版本。LMDE 7代号"Gigi"基于Debian 13开发,将包含libAdapta库以支持Gtk4应用的主题功能。新版本将停止提供32位版本支持。同时Cinnamon桌面的Wayland支持持续改进,在菜单、状态小程序和键盘输入处理方面表现更佳,有望成为完整支持Wayland的重要桌面环境之一。
Anthropic研究团队开发的REINFORCE++算法通过采用全局优势标准化解决了AI训练中的"过度拟合"问题。该算法摒弃了传统PPO方法中昂贵的价值网络组件,用统一评价标准替代针对单个问题的局部基准,有效避免了"奖励破解"现象。实验显示,REINFORCE++在处理新问题时表现更稳定,特别是在长文本推理和工具集成场景中展现出优异的泛化能力,为开发更实用可靠的AI系统提供了新思路。