谷歌的Gemini应用程序迎来了一项重要更新,终于开始支持音频文件处理功能。这一扩展标志着该AI助手在多媒体内容处理能力上的重要进步。
用户现在可以直接在Gemini应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。这项新功能使得用户能够更便捷地与AI进行交互,无需再依赖纯文本输入。
此次更新大大拓展了Gemini的应用场景。用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话。这种多模态的交互方式显著提升了用户体验。
谷歌表示,这项功能的推出是其不断改进AI助手能力的一部分。音频处理功能的加入使Gemini能够更好地理解和响应用户的多样化需求,为用户提供更加智能和全面的服务。
该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区。用户可以通过更新应用程序来体验这一新功能。
Q&A
Q1:Gemini应用程序新增了什么功能?
A:Gemini应用程序新增了音频文件处理功能,用户现在可以直接在应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。
Q2:音频功能支持有什么实际用途?
A:用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话,大大拓展了应用场景。
Q3:这个音频功能什么时候能用?
A:该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区,用户可以通过更新应用程序来体验。
好文章,需要你的鼓励
YouTube开始推出肖像检测工具,帮助创作者识别和举报使用其面部特征的AI生成视频。该系统类似于版权检测机制,目前处于测试阶段,仅向部分创作者开放。用户需要提供政府身份证件照片和面部视频来验证身份。系统会标记疑似包含用户肖像的视频,但无法保证100%准确识别AI内容。YouTube将根据多项因素决定是否移除举报的视频。
华中科技大学研究团队发现,通过让AI模型学习解决几何问题,能够显著提升其空间理解能力。他们构建了包含约30000个几何题目的Euclid30K数据集,使用强化学习方法训练多个AI模型。实验结果显示,几何训练在四个空间智能测试基准上都带来显著提升,其中最佳模型达到49.6%准确率,超越此前最好成绩。这项研究揭示了基础几何知识对培养AI空间智能的重要价值。
谷歌宣布在AI Studio平台中引入"氛围编程"体验,让编程和非编程用户都能更轻松地开发应用程序。用户可通过简单提示生成可运行的应用,新功能包括应用画廊、模型选择器、安全变量存储等。平台还添加了模块化"超能力"功能和"手气不错"按钮来激发创意。完成的原型应用可一键部署到谷歌云运行平台。此次更新正值业界期待谷歌即将发布Gemini 3.0大语言模型。
中国人民大学研究团队开发了Tool-Light框架,通过信息熵理论解决AI工具使用中的过度调用、调用不足和过度思考问题。该框架采用熵引导采样和两阶段自演化训练,让AI学会合理使用外部工具。在10个推理任务测试中,Tool-Light显著提升了AI的效率和准确性,为AI工具集成推理提供了新的解决方案。