据The Information报道,开发ChatGPT模型和产品的OpenAI公司计划在2026年第一季度推出新的语音大语言模型,这将是迈向基于语音的物理硬件设备的关键一步。
整合团队资源提升语音技术
引用多位熟悉计划的消息人士(包括现任和前任员工)的话,The Information报道称,OpenAI已经努力将工程、产品和研究等多个团队整合到一个专注于改进音频模型的项目下。公司研究人员认为,目前的音频模型在准确性和速度方面都落后于文本模型。
此外,他们观察到相对较少的ChatGPT用户选择使用语音界面,大多数人更倾向于文本界面。希望通过大幅改进音频模型能够改变用户行为,让用户更多地使用语音界面,从而使模型和产品能够部署在更广泛的设备中,比如汽车。
硬件设备战略布局
OpenAI计划在未来几年推出一系列物理设备,首先是专注于音频的设备。公司内部人士已经讨论了未来设备的各种形式,包括智能扬声器和智能眼镜,但整个产品线的重点都是音频界面而不是基于屏幕的界面。
OpenAI并非独行者。其竞争对手,包括Google、Meta、Amazon等公司,也越来越多地将研发工作转向专注于语音和音频界面的产品和技术,比如Meta在智能眼镜领域的推进。
语音助手技术的新机遇
当然,这并不是首次出现这样的技术推进。几年前曾经出现过Alexa、Google Assistant和(在一定程度上)Siri驱动的语音助手设备的繁荣期。这些助手在某些用户群体中相对受欢迎,通常是一般技术消费者而非核心技术专家。
然而,这些设备存在重大局限性。基于大语言模型的新方法可能会开创新的可能性(和风险)。
一些AI产品开发者,包括前苹果设计主管乔纳森·艾维,认为语音控制产品比基于屏幕的产品更不容易让人上瘾,并将此作为追求音频界面的理由,尽管他们通常没有引用可靠的证据来支持这一点。
OpenAI首款专注于音频的物理设备目前预计将在大约一年后发布,但我们还不知道它会是什么样子。
Q&A
Q1:OpenAI为什么要重组团队开发语音AI技术?
A:因为OpenAI研究人员认为当前的音频模型在准确性和速度方面都落后于文本模型。同时他们发现很少ChatGPT用户使用语音界面,大多数人更喜欢文本界面。通过改进音频模型,希望改变用户行为,让产品能部署在更多设备中。
Q2:OpenAI计划推出哪些硬件产品?
A:OpenAI计划推出一系列物理设备,首先是专注于音频的设备。公司内部讨论过的未来设备形式包括智能扬声器和智能眼镜,但整个产品线的重点都是音频界面而不是基于屏幕的界面。
Q3:OpenAI的语音硬件设备什么时候能买到?
A:根据报道,OpenAI的新音频大语言模型计划在2026年第一季度推出,而首款专注于音频的物理设备目前预计将在大约一年后发布,但具体外观和功能还不清楚。
好文章,需要你的鼓励
Plaud在CES上推出两款AI笔记新品。NotePin S延续简约设计,可作为手环、项链或胸针使用,新增即时高亮按钮功能,售价179美元。同时发布的Plaud Desktop可录制在线会议,支持Zoom、Google Meet等平台,采用原生录制方式而非机器人参会。两款产品均可通过Plaud生态系统统一管理录音内容。
瑞士ETH苏黎世联邦理工学院等机构联合开发的WUSH技术,首次从数学理论层面推导出AI大模型量化压缩的最优解。该技术能根据数据特征自适应调整压缩策略,相比传统方法减少60-70%的压缩损失,实现接近零损失的模型压缩,为大模型在普通设备上的高效部署开辟了新路径。
Instagram负责人亚当·莫塞里发布深度分析,指出我们正进入"无限合成内容"新时代,AI生成的照片和视频与真实内容越来越难以区分。他表示,人们需要从默认相信眼见转向保持怀疑态度,关注内容发布者身份和动机。莫塞里认为相机公司发展方向错误,过度追求完美效果。平台需要构建更好的创作工具,标记AI生成内容,验证真实内容,并提供发布者可信度信号。
弗吉尼亚大学团队创建了Refer360数据集,这是首个大规模记录真实环境中人机多模态交互的数据库,涵盖室内外场景,包含1400万交互样本。同时开发的MuRes智能模块能让机器人像人类一样理解语言、手势和眼神的组合信息,显著提升了现有AI模型的理解准确度,为未来智能机器人的广泛应用奠定了重要基础。