谷歌的Gemini应用程序迎来了一项重要更新,终于开始支持音频文件处理功能。这一扩展标志着该AI助手在多媒体内容处理能力上的重要进步。
用户现在可以直接在Gemini应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。这项新功能使得用户能够更便捷地与AI进行交互,无需再依赖纯文本输入。
此次更新大大拓展了Gemini的应用场景。用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话。这种多模态的交互方式显著提升了用户体验。
谷歌表示,这项功能的推出是其不断改进AI助手能力的一部分。音频处理功能的加入使Gemini能够更好地理解和响应用户的多样化需求,为用户提供更加智能和全面的服务。
该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区。用户可以通过更新应用程序来体验这一新功能。
Q&A
Q1:Gemini应用程序新增了什么功能?
A:Gemini应用程序新增了音频文件处理功能,用户现在可以直接在应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。
Q2:音频功能支持有什么实际用途?
A:用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话,大大拓展了应用场景。
Q3:这个音频功能什么时候能用?
A:该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区,用户可以通过更新应用程序来体验。
好文章,需要你的鼓励
英伟达宣布推出Alpamayo-R1开源推理视觉语言模型,专为自动驾驶研究设计,这是首个专注于自动驾驶的视觉语言行动模型。该模型基于英伟达Cosmos Reason模型构建,能够处理文本和图像,让车辆"看见"周围环境并做出决策。英伟达还发布了Cosmos Cookbook开发指南,帮助开发者训练和使用模型。这些技术对实现L4级自动驾驶至关重要。
NVIDIA研究团队开发的OmniVinci是一个突破性的多模态AI模型,能够同时理解视觉、听觉和文本信息。该模型仅使用0.2万亿训练样本就超越了使用1.2万亿样本的现有模型,在多模态理解测试中领先19.05分。OmniVinci采用三项核心技术实现感官信息协同,并在机器人导航、医疗诊断、体育分析等多个实际应用场景中展现出专业级能力,代表着AI向真正智能化发展的重要进步。
波兰AI语音公司ElevenLabs由两位30岁创始人Staniszewski和Dabkowski创立,其AI语音技术能够生成极其逼真的人声。公司在四年内从零发展到估值66亿美元,两位创始人均成为亿万富翁。该公司年收入1.93亿美元,净利润1.16亿美元,服务客户包括思科、Epic Games等知名企业。尽管面临深度伪造等技术滥用风险,ElevenLabs仍在与谷歌、微软等科技巨头竞争AI语音市场主导地位。
Salesforce研究团队发布BLIP3o-NEXT,这是一个创新的图像生成模型,采用自回归+扩散的双重架构设计。该模型首次成功将强化学习应用于图像生成,在多物体组合和文字渲染方面表现优异。尽管只有30亿参数,但在GenEval测试中获得0.91高分,超越多个大型竞争对手。研究团队承诺完全开源所有技术细节。