据 Google 周二在博客文章中表示,Gemini 2.5 是一个新的 AI 推理模型,旨在与 DeepSeek R1 展开竞争,目前在 LMArena 整体评分中排名最高。
Google 将新一代 Gemini 2.5 模型系列描述为"思考型模型",这类模型会在给出最终结果前递归分析答案。根据 LMArena 的基准测试,Gemini 2.5 在推理、科学、数学和代理编程方面处于领先地位。不过,它并非在所有测试中都胜出。例如,在 LiveCodeBench v5 测试中,OpenAI 的 o3-mini 仍然领先于它。
Gemini 2.5 目前正向付费高级用户推出。有 Reddit 用户报告称,他们需要删除并重新安装 Gemini 应用才能看到 2.5 版本。在桌面端,用户可以在 Google AI Studio 中找到 Gemini 2.5。
Google 的 AI 模型相比竞争对手的一大优势在于其高 token 处理率——即理解或生成复杂数据集的能力。Google 一直宣传 Gemini 是能够处理大上下文窗口并具有高 token 输出的 AI。在社交媒体平台 X (前身为 Twitter) 上,人们也在实验 Gemini 2.5 的能力。Google DeepMind 的员工研究员 Fei Xia 成功地将一个简单的三层蛋糕草图转换成了 3D 打印文件。
Google 展示了一段视频,演示了 Gemini 2.5 如何在几秒钟内制作一个简单的无尽跑酷视频游戏。另一位 X 用户则制作了一个简单的飞行模拟视频游戏。
Google 尚未立即回应置评请求。
Gemini 2.5 的推出是 AI 竞技场中投入的最新武器。今年早些时候,来自中国的 DeepSeek R1 的发布让美国 AI 公司警觉起来。DeepSeek 发布了一个免费开源的推理模型,其效率超过了 OpenAI 现有的产品。
Google 也在 AI 领域押下重注。生成式技术已渗透到公司产品组合的方方面面,从搜索到文档都不例外。Google 计划仅在 2025 年就投资 750 亿美元用于 AI 开发。考虑到根据 Grand View Research 的预测,到 2030 年 AI 市场规模将增长到 1.8 万亿美元,Google 在这个领域占据主导地位具有强大的经济动机。
除了 Gemini 2.5,Google 今年早些时候还推出了旨在提供更快推理能力的 Gemini 2.0 Flash Thinking。上个月,Google 发布了 Gemini Code Assist,这是一个具有大量输入 token 支持的免费 AI 编程工具。
好文章,需要你的鼓励
今天讲的出海案例是依米康,这家数据中心温控与液冷设备厂商正在把泰国纳入海外交付体系,并用生产线、总装车间和焓差实验室承接算力设施订单。
BioMatrix是首个将分子序列、分子三维结构、蛋白质序列、蛋白质三维结构和自然语言统一在单一语言模型中的生物基础模型,在80项任务中77项达到最优或第二优。
Salesforce正式推出Help Agent,这是基于Agentforce平台的预封装AI客服智能体,可在数分钟内连接企业知识库、操作功能及网页、短信、语音等沟通渠道。该产品同步推出按解决率计费模式,每次成功自主解决客户问题收费2美元,无需按token或操作次数计费。Help Agent支持低代码构建,内置测试功能,并配备全新客户服务门户。该产品预计于2026年7月正式上线。
浙江大学提出SKILLHARNESS框架,通过为AI电脑助手的每项技能附加安全边界,从成功、失败和风险三类经历中学习,使AI在动态危险环境中安全高效地完成任务。