专注于企业级语音合成和对话技术的人工智能平台开发商Deepgram Inc.今日宣布推出专为开发者设计的语音驱动"操作系统"。
这款新工具名为Saga,作为一个通用语音接口,可以直接嵌入开发者环境,让他们仅凭声音就能控制工具和代码。公司表示,这款新助手或副驾驶位于现有工具之上,允许开发者将粗糙的想法转化为AI编码提示,而无需在不同窗口间切换。
现代开发者使用众多不同的工具,通常配备多个显示器,在导入和文件之间跳转来完善他们的想法。他们在试图弄清楚解释器为什么无法看到其工作上下文时引入代码。
Deepgram将这种切换称为生产力上的"静默税",由alt-tab切换、在显示器间查看、在文件间查看、测试并最终部署代码却发现错误弹出所产生。
"你说话的速度比打字快,阅读速度比写作快。现代开发者技术栈尚未以AI作为一流操作模式重新构想,"Deepgram首席执行官兼联合创始人Scott Stephenson表示。"开发者在工具间切换上花费了太多精神能量,而不是用于构建。"
Stephenson表示,通过语音而非仅仅按键重新构想开发过程,开发者可以在电脑前获得完全不同的体验。对于那些在其他环境中长大、习惯于热键操作的人来说,这似乎能高速运转,但语音感觉更自然——尽管在开放式办公室中,这可能会引起一些关注。
根据Deepgram的介绍,Saga能够轻松集成众多AI原生编码环境,包括Cursor和Windsurf,并且可以在Linear、Asana、Jira或Slack等项目管理软件中维护状态更新。用户还可以通过要求它从Google Docs、Gmail或Google Sheets中提取信息来将该信息整合到代码中,或者只是告诉他们需要知道什么,从而将其用于日常任务。
开发者可以向助手表达他们的想法,例如说:"创建一个响应表情符号的Slack机器人。"作为回应,Saga会将他们的想法转换为可与Cursor等工具一起使用的一次性提示。
该工具还可以用于加速文档、工单或描述符的处理,让开发者在漫长编码期结束时快速完成原本繁琐的打字工作。
公司表示,Saga不仅仅是一个助手,而是一个"可编程操作系统",集成到整个工作流程中。为此,Saga通过模型上下文协议(连接AI模型到数据集和工具)和各种标准接口进行交互。这允许团队轻松将其连接到任何设置、开发者环境或集成。
"Saga代表了一个根本性转变——从传统语音助手结束的地方开始,将语音作为接口提供,"Deepgram高级产品经理Sharon Yeh表示。"我们不是要求开发者学习新命令或更改工具。我们为他们提供了一种自然的方式来编排完整的工作流程,通过将语音转化为从想法到执行的最快路径。"
好文章,需要你的鼓励
Runway推出最新AI模型Aleph,旨在重新定义视频创作与编辑方式。基于通用世界模型和模拟模型研究,Aleph提供对话式AI工具,能即时对现有或生成的视频进行复杂编辑。用户只需简单提示,即可删除物体、更换背景或重塑整个场景。与以往专注于文本生成视频的模型不同,Aleph强调"流畅编辑",确保场景、角色和环境的一致性,无需逐帧修复缺陷,为电影制作者和广告商提供更高效的工作流程。
斯坦福大学NLP研究小组发布了全新的2024版GloVe词向量,这是对2014年原版的重大升级。新版本使用维基百科、Gigaword新闻数据和Dolma语料库进行训练,新增超过70万词汇,涵盖疫情、科技、网络文化等现代概念。测试显示新版本在处理当代文本、非西方人名地名和社交媒体内容方面表现显著优于旧版本,为自然语言处理应用提供了更准确的语言理解工具。
TeleAI团队发布TeleChat2、TeleChat2.5和T1三款大语言模型的技术报告,详述了从10万亿tokens预训练到强化学习优化的完整开发过程。T1-115B在数学推理上超越OpenAI o1-mini,展现了国产AI模型的技术突破。研究采用4D并行训练策略,在8000个华为昇腾NPU上完成训练,并全面开源以促进AI技术发展。