谷歌的Gemini应用程序迎来了一项重要更新,终于开始支持音频文件处理功能。这一扩展标志着该AI助手在多媒体内容处理能力上的重要进步。
用户现在可以直接在Gemini应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。这项新功能使得用户能够更便捷地与AI进行交互,无需再依赖纯文本输入。
此次更新大大拓展了Gemini的应用场景。用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话。这种多模态的交互方式显著提升了用户体验。
谷歌表示,这项功能的推出是其不断改进AI助手能力的一部分。音频处理功能的加入使Gemini能够更好地理解和响应用户的多样化需求,为用户提供更加智能和全面的服务。
该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区。用户可以通过更新应用程序来体验这一新功能。
Q&A
Q1:Gemini应用程序新增了什么功能?
A:Gemini应用程序新增了音频文件处理功能,用户现在可以直接在应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。
Q2:音频功能支持有什么实际用途?
A:用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话,大大拓展了应用场景。
Q3:这个音频功能什么时候能用?
A:该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区,用户可以通过更新应用程序来体验。
好文章,需要你的鼓励
这期是技术加情怀了。极少数人基于热情和对卓越的执念,构建了数十亿人每天依赖但普通人从不知晓的基础设施。
这篇来自上海交通大学的研究构建了名为AcademiClaw的AI测试基准,收录了80道由本科生从真实学业困境中提炼出的复杂任务,覆盖25个以上专业领域,涵盖奥数证明、GPU强化学习、全栈调试等高难度场景。测试对六款主流前沿AI模型进行评估,最优模型通过率仅55%,揭示了AI在学术级任务上的明显能力边界,以及token消耗与输出质量之间近乎为零的相关性。
Antigravity A1无人机推出"大春季更新",新增AI智能剪辑、语音助手、延时摄影模式及升级版全向避障系统。用户可通过语音命令控制Sky Genie、深度追踪等核心功能,虚拟驾驶舱支持第三人称视角飞行。随着产品进入墨西哥市场,Antigravity全球覆盖已近60个国家,持续推动无人机向更智能、更易用方向发展。
Meta AI安全团队于2026年5月发布了代码世界模型(CWM)的预发布安全评估报告(arXiv:2605.00932v1)。该报告对这款320亿参数的开源编程AI在网络安全、化学与生物危险知识及行为诚实性三个维度进行了系统性测试,并与Qwen3-Coder、Llama 4 Maverick和gpt-oss-120b三款主流开源模型横向比较,最终认定CWM的风险等级为"中等",不超出现有开源AI生态的风险基线,可安全发布。