谷歌的Gemini应用程序迎来了一项重要更新,终于开始支持音频文件处理功能。这一扩展标志着该AI助手在多媒体内容处理能力上的重要进步。
用户现在可以直接在Gemini应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。这项新功能使得用户能够更便捷地与AI进行交互,无需再依赖纯文本输入。
此次更新大大拓展了Gemini的应用场景。用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话。这种多模态的交互方式显著提升了用户体验。
谷歌表示,这项功能的推出是其不断改进AI助手能力的一部分。音频处理功能的加入使Gemini能够更好地理解和响应用户的多样化需求,为用户提供更加智能和全面的服务。
该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区。用户可以通过更新应用程序来体验这一新功能。
Q&A
Q1:Gemini应用程序新增了什么功能?
A:Gemini应用程序新增了音频文件处理功能,用户现在可以直接在应用中上传和处理各种音频文件格式,包括语音记录、音乐片段和其他音频内容。
Q2:音频功能支持有什么实际用途?
A:用户可以上传会议录音让AI进行总结,分析音乐文件获取相关信息,或者通过语音输入更自然地与AI对话,大大拓展了应用场景。
Q3:这个音频功能什么时候能用?
A:该功能目前正在逐步向全球用户推出,预计将在未来几周内覆盖所有支持地区,用户可以通过更新应用程序来体验。
好文章,需要你的鼓励
美国多州和部分国家要求特定应用进行年龄验证,澳大利亚已禁止16岁以下用户使用社交媒体。新提案《应用商店问责法案》建议由苹果和谷歌负责统一验证用户年龄,而非各开发者单独验证。这将提升用户体验,用户只需向苹果或谷歌验证一次身份。凭借苹果在隐私保护方面的优势,该方案可扩展至Safari浏览器,为需要年龄验证的网站提供确认信息,而无需透露用户个人数据。
香港大学团队开发的"炼金术师"数据筛选系统,能从海量图片中精选一半高价值数据,训练出比使用全量数据更优秀的AI图像生成模型。该方法通过观察模型学习反应判断数据价值,发现适度复杂的图片比简单图片更有训练效果,实现了5倍训练加速和显著性能提升。
AI编程助手Cursor背后的公司Anysphere宣布收购AI代码审查工具初创公司Graphite。据报道收购价远超Graphite今年早些时候B轮融资时2.9亿美元的估值。此次收购具有战略意义,将AI代码生成与AI代码审查工具相结合,可大幅提升从编写到交付的整体效率。Anysphere估值已达290亿美元,近期频繁收购,上月收购技术招聘公司,今年7月还收购AI客户关系管理初创公司Koala的团队。
哥伦比亚大学等机构研究团队发现,在AI模型的强化学习训练中存在一个悖论现象:阻碍探索和阻碍利用竟然都能提升性能。研究揭示了裁剪技术实际是熵调节器而非学习信号,策略熵与性能无直接因果关系,并提出奖励错配理论解释随机奖励的积极效果,为AI训练方法设计提供了新的理论基础。