Amazon 推出了一个新的基础模型,该模型不仅能理解你在说什么,还能理解你是如何表达的,包括语气、犹豫等细节。
Amazon Nova Sonic 是 Nova 系列基础模型家族的最新成员,该系列首次于 2024 年 12 月推出。它可以接受语音输入并实时生成语音响应,同时为开发者生成文字记录。
传统的基于语音的 AI 应用通常需要将三个独立的模型组合在一起:语音识别模型、响应生成模型和语音合成模型。Amazon 声称 Nova Sonic 将这些功能统一到了单个模型中。
Amazon 在其公告中表示:"这种统一使模型能够根据声学环境 (如语气、风格) 和语音输入来调整生成的语音响应,从而实现更自然的对话。Nova Sonic 甚至能理解人类对话的细微差别,包括说话者的自然停顿和犹豫,在适当的时机开始说话,并能优雅地处理打断情况。"
该电商巨头发布了一段示例音频,展示了这种场景的应用。在录音中,一个 AI 旅行助手在处理客户预订行程时,察觉到客户语气中对机票价格的担忧后,随即采用了令人安心的语气进行回应。
Amazon 的高级机器学习解决方案架构师 Osman Ipek 在一段视频中解释道:"Amazon Nova Sonic 不仅理解你说什么,还理解你是如何说的。因此它会调整回应以匹配你的沟通方式。如果你兴奋地说话,Nova Sonic 的回应也会带着相似的热情。如果你采用严肃的语气,它会通过识别音调和情感等韵律元素相应地调整。它创造了真正的会话式互动。"
Nova Sonic 通过 Amazon Bedrock 的双向流式 API 提供服务,"能够理解各种说话风格的流式语音,并生成富有表现力的语音响应,动态适应输入语音的韵律。"
从本质上说,该模型可以调节其语音,在被打断时会暂停然后恢复,这使得对话流程更加自然。
API 代码可以与基于分析的情感分析相关联。但模型的大部分语气变化预计将由大语言模型提示驱动。
Nova Sonic 模型不提供语音控制参数的直接访问。相反,用户通过系统提示来指导模型应采用的语气。例如:
你是一个朋友。你和用户将进行实时对话交流。保持简短的回应,在闲聊场景中通常用两到三句话。你可以在句子开头使用方括号表示情绪,如 [愉快]、[中性] 或其他表演指示如 [欢快]。每个表演指示仅使用一对方括号。
Nova Sonic 支持 32K tokens 的音频上下文窗口,默认连接限制为 8 分钟,可以续期以继续更长时间的对话。它可以通过检索增强生成 (RAG) 与企业系统对接,支持函数调用和面向代理的工作流,可以在其支持的语言中使用各种说话风格 - 目前仅支持美式和英式英语。
IT 咨询公司 Gartner 在 4 月发布了一份题为"对话式 AI 解决方案市场指南"的报告。该公司发现,"在众多面向客户和员工的使用场景中,对 [对话式 AI] 功能的需求正在增加。然而,在这个快速发展的市场中,领导者们发现很难分辨哪些解决方案最能满足他们的需求。"
Gartner 预计对话式 AI 市场规模将从 2023 年的 82 亿美元增长到 2032 年的 360 亿美元。
好文章,需要你的鼓励
尽管全球企业AI投资在2024年达到2523亿美元,但MIT研究显示95%的企业仍未从生成式AI投资中获得回报。专家预测2026年将成为转折点,企业将从试点阶段转向实际部署。关键在于CEO精准识别高影响领域,推进AI代理技术应用,并加强员工AI能力培训。Forrester预测30%大型企业将实施强制AI培训,而Gartner预计到2028年15%日常工作决策将由AI自主完成。
这项由北京大学等机构联合完成的研究,开发了名为GraphLocator的智能软件问题诊断系统,通过构建代码依赖图和因果问题图,能够像医生诊断疾病一样精确定位软件问题的根源。在三个大型数据集的测试中,该系统比现有方法平均提高了19.49%的召回率和11.89%的精确率,特别在处理复杂的跨模块问题时表现优异,为软件维护效率的提升开辟了新路径。
2026年软件行业将迎来定价模式的根本性变革,从传统按席位收费转向基于结果的付费模式。AI正在重塑整个软件经济学,企业IT预算的12-15%已投入AI领域。这一转变要求建立明确的成功衡量指标,如Zendesk以"自动化解决方案"为标准。未来将出现更精简的工程团队,80%的工程师需要为AI驱动的角色提升技能,同时需要重新设计软件开发和部署流程以适应AI优先的工作流程。
这项由德国达姆施塔特工业大学领导的国际研究团队首次发现,当前最先进的专家混合模型AI系统存在严重安全漏洞。通过开发GateBreaker攻击框架,研究人员证明仅需关闭约3%的特定神经元,就能让AI的攻击成功率从7.4%暴增至64.9%。该研究揭示了专家混合模型安全机制过度集中的根本缺陷,为AI安全领域敲响了警钟。