随着AI系统功能日益强大,语音正在快速成为我们与机器沟通的默认方式。法国AI初创公司Mistral凭借其首个开源模型进入音频竞赛,旨在通过开放权重的替代方案挑战封闭企业系统的主导地位。
最近,Mistral宣布发布Voxtral,这是其首个面向企业的音频模型系列。
该公司将Voxtral定位为首个能够在生产环境中部署"真正可用的语音智能"的开源模型。
换句话说,开发者不再需要在便宜但转录效果差且无法真正理解语音内容的开源系统,与功能良好但封闭、成本更高且部署控制力较低的系统之间做出选择。
对于企业而言,这意味着Voxtral提供了一个经济实惠的替代方案,公司声称其成本"不到同类解决方案的一半"。
Mistral表示,Voxtral可以转录长达30分钟的音频。由于其基于大语言模型Mistral Small 3.1的架构,它能够理解长达40分钟的内容,允许用户询问有关音频内容的问题、生成摘要,或将语音命令转化为实时操作,如调用API或运行函数。Voxtral还支持多语言,能够转录和理解英语、西班牙语、法语、葡萄牙语、印地语、德语、荷兰语和意大利语。
该公司提供两种"语音理解模型"变体。第一种是Voxtral Small,拥有240亿参数,适用于生产规模部署,可与ElevenLabs Scribe、GPT-4o-mini和Gemini 2.5 Flash竞争。
第二种是Voxtral Mini,拥有30亿参数,适用于本地和边缘部署。还有一个超低成本、精简、快速的API版本,名为Voxtral Mini Transcribe,专为纯转录用例优化,承诺以不到一半的价格超越OpenAI Whisper的性能。
用户可以通过在Hugging Face上下载API或在Mistral的聊天机器人Le Chat中测试模型来免费试用Voxtral。据公司介绍,将API集成到应用程序中的起价为每分钟0.001美元。
此次发布是在Mistral宣布Magistral一个月后进行的,Magistral是其首个推理模型系列,通过逐步解决问题来提高可靠性。
Mistral是欧洲顶级AI公司之一,以倡导开源AI模型而闻名。本月早些时候,TechCrunch报道称,该公司正在与阿布扎比MGX基金等投资者洽谈,计划筹集高达10亿美元的股权融资。
好文章,需要你的鼓励
惠普企业与爱立信合作开设研究设施,验证双模5G核心服务,为电信运营商提供"无缝"下一代核心网络。联合验证实验室将解决多供应商基础设施部署中的关键挑战,进行互操作性测试。实验室位于瑞典爱立信总部附近,2025年底投入运营。该方案结合爱立信双模5G核心服务与惠普服务器、网络架构和红帽OpenShift平台,支持5G和4G网络,降低复杂性和运营成本。
北京大学团队开发出WoW世界模型,这是首个真正理解物理规律的AI系统。通过200万机器人互动数据训练,WoW不仅能生成逼真视频,更能理解重力、碰撞等物理定律。其创新的SOPHIA框架让AI具备自我纠错能力,在物理理解测试中达到80.16%准确率。该技术将推动智能机器人、视频制作等领域发展,为通用人工智能奠定重要基础。
高通在骁龙峰会2025上发布新一代骁龙8 Elite Gen 5芯片,AI处理速度从15令牌/秒提升至220令牌/秒,为真正的AI代理性能奠定硬件基础。AI首席官马拉迪表示,个性化AI助手即将到来,能够利用设备本地文档和图片等数据提供智能服务。尽管生成式AI仍面临准确性挑战,但硬件已不再是障碍,关键在于制造商的集成应用。AI代理将改变人机交互方式,自动化繁琐任务,让用户更高效地使用设备功能。
香港大学和蚂蚁集团联合推出PromptCoT 2.0,这是一种让AI自动生成高质量训练题目的创新方法。通过"概念-思路-题目"的三步策略,AI能像老师备课一样先构思解题思路再出题,大幅提升了题目质量和训练效果。实验显示该方法在数学竞赛和编程任务上都取得了显著提升,为解决AI训练数据稀缺问题提供了新思路。