人工智能初创公司 ElevenLabs 在最近完成 1.8 亿美元大规模融资后,又迈出了新的技术步伐。这家以音频生成技术闻名的公司推出了其首个独立的语音转文本模型 Scribe。
这家估值达 33 亿美元的初创公司此前通过其丰富的声音库为许多公司提供语音转文本服务。如今,公司正寻求进军语音识别领域,与 Gladia、Speechmatics、AssemblyAI、Deepgram 以及 OpenAI 的 Whisper 模型展开竞争。
ElevenLabs 的 Scribe 模型一经推出就支持超过 99 种语言。该公司将其中 25 种语言归类为高精度类别,这些语言的词错率低于 5%。这份名单包括英语 (声称准确率达 97%)、法语、德语、印地语、印尼语、日语、卡纳达语、马拉雅拉姆语、波兰语、葡萄牙语、西班牙语和越南语。其他语言则按照词错率被分为不同等级:高等 (5% 到 10%)、良好 (10% 到 20%) 和中等 (25% 到 50%)。
公司表示,在 FLEURS 和 Common Voice 基准测试中,该模型在多种语言上的表现超过了 Google Gemini 2.0 Flash 和 Whisper Large V3。
去年,ElevenLabs 为其 AI 对话代理平台开发了语音转文本组件。但这是该公司首次发布独立的语音识别模型。在上个月与 TechCrunch 的对话中,CEO Mati Staniszewski 谈到了改进语音识别模型的计划。
"我们希望能更好地理解对话中你所说的内容。我们正在研究如何不仅仅局限于生成内容,而是理解和转录语音," Staniszewski 当时表示。"很多人说语音转文本是一个已解决的问题。但对于许多语言来说,效果其实很差。我们认为可以开发出更好的语音识别模型,因为我们有内部团队可以标注数据并提供快速反馈。"
该模型还具备智能说话人分离功能,可识别发言者身份,支持词级时间戳以实现精确字幕,并能自动标注笑声等声音事件。该公司在其工作室中提供了直接转录视频内容并添加字幕的功能。
Scribe 目前仅支持预录制的音频格式。公司表示将很快推出低延迟的实时版本模型。这意味着目前该模型还不适用于会议记录或语音笔记等场景。
ElevenLabs 为 Scribe 定价为每小时音频转录 0.40 美元。虽然这个价格具有竞争力,但其部分竞争对手目前提供更低的音频转录价格,同时在功能上有所差异。
好文章,需要你的鼓励
亚马逊CEO贾西宣布,AWS实用计算产品高级副总裁彼得·德桑蒂斯将领导新的AI组织,专注于Nova模型发展、定制芯片开发和量子计算。作为领导层变动的一部分,德桑蒂斯将接管人工通用智能团队,原负责人罗希特·普拉萨德将于2025年底离职。新组织还包括皮特·阿贝尔领导前沿模型研究团队。
微软亚洲研究院与清华大学联合提出双向感知塑造技术,通过创新的两阶段训练方法解决AI视觉理解中的关键问题。该技术让AI学会正确聚焦重要视觉信息,避免被无关内容误导。仅用1.3万训练样本就在八个基准测试中平均提升8.2%性能,超越使用数十万样本的专门模型,为AI视觉推理能力提升开辟新路径。
最新调查显示,近半数CIO将AI采用和自动化提升列为未来五年的首要任务。超过三分之一的受访者将加强业务连续性和灾难恢复作为重点,同等比例的企业将人才技能发展列为优先事项。尽管AI投资成为焦点,但投资回报率仍不明朗,近三分之二的商业领袖估计AI投资回报率仅为50%或更低。
上海交通大学研究团队开发了TimeBill框架,解决大语言模型在实时应用中的时间不确定性问题。该系统通过精确预测回答长度和执行时间,动态调整AI记忆管理策略,确保在规定时间内完成任务的同时保持回答质量。实验显示TimeBill在各种时间预算下都能实现最佳的完成率与性能平衡,为AI在自动驾驶、工业控制等安全关键领域的应用提供了重要技术支撑。