谷歌带有语音输入功能的搜索实时功能现已在美国地区的iOS和Android应用程序中推出。用户需要在实验室模式中选择启用AI模式才能使用该功能,启用后便可与搜索进行双向语音对话。
要使用此功能,用户需打开谷歌应用程序并点击新的实时图标进行语音提问。谷歌将通过AI生成音频进行回应,用户还可以自然地提出后续问题。该功能的技术核心是一个具备先进语音功能的定制版Gemini。
谷歌表示,这项功能特别适合在外出或多任务处理时使用,比如打包行李。在谷歌提供的示例中,用户询问如何防止亚麻裙子在行李箱中起皱,Gemini进行了语音回应。随后用户提出了几个后续问题,无需退出搜索实时界面或再次点击实时图标。用户甚至可以在打开其他应用程序时继续对话,也可以查看谷歌回应的文字记录,并在希望转换为文字对话时输入更多问题。
虽然该功能具有成为便利工具的潜力,但谷歌获取信息的原始来源可能无法从这种交互中获得任何流量。谷歌确实在搜索实时界面上显示了来自网络各处的链接,但这些链接以微小卡片的形式显示,如果用户确实在与Gemini对话时同时进行其他活动,这些链接很容易被忽略。
在未来几个月中,谷歌将扩展搜索实时功能,增加实时显示和询问用户所见内容的能力。谷歌在今年的I/O大会上宣布了这项特定功能。例如,用户可以向搜索展示一道复杂的数学题并请求帮助解决,或要求解释难以理解的概念。
好文章,需要你的鼓励
NVIDIA团队开发的SANA-Sprint技术实现了AI图像生成的重大突破,将传统需要20步的生成过程压缩至1步,在H100上仅需0.1秒即可生成1024×1024高清图像,速度比现有最快模型提升10倍以上。该技术通过创新的混合蒸馏策略,在大幅提升速度的同时保持了图像质量,并支持实时交互应用,为AI绘画从专业工具向大众应用的转变奠定了基础。
初创公司Positron获得5160万美元A轮融资,推出专门针对AI推理的Atlas芯片。该公司声称其芯片在性能功耗比和成本效益方面比英伟达H100高出2-5倍,并已获得Cloudflare等企业客户采用。Positron专注于内存优化设计,无需液体冷却,可直接部署在现有数据中心。公司计划2026年推出支持16万亿参数模型的下一代Titan平台。
北京人工智能研究院团队开发的DiagNote模型通过模仿人类做笔记的习惯,解决了AI在多轮视觉对话中容易"失忆"的问题。该研究构建了专门的MMDiag数据集,设计了双模块协作的AI架构,让机器学会像人类一样通过标记重点区域来保持专注力,为更自然的人机视觉交流奠定了基础。