Thinking Machines正在开发可实时响应用户的AI"交互模型"。
由前OpenAI首席技术官Mira Murati创立的AI公司Thinking Machines,于近日宣布正在研发一种名为"交互模型"的全新技术。根据Thinking Machines的介绍,交互模型将允许人们"以自然协作的方式与AI合作——持续接收音频、视频和文本输入,并实时思考、响应和行动"。
Thinking Machines对此解释道:
当前的模型以单线程方式感知现实。在用户完成输入或说话之前,模型处于等待状态,无法感知用户的行为或状态;而在模型生成内容的过程中,其感知也处于冻结状态,无法接收新信息,直到生成完成或被打断为止。这种机制形成了人机协作的窄带瓶颈,限制了用户的知识、意图和判断力传递给模型的效率,也限制了模型工作内容被理解的程度。这就好比试图通过电子邮件而非面对面交流来解决一个关键分歧。
Thinking Machines认为,通过让AI在任意模态下实现实时交互,可以有效解决这一带宽瓶颈问题,从而让AI界面主动适应人类,而非迫使人类去迁就AI界面。
Thinking Machines还展示了多个交互模型的实际应用场景,包括在故事中监听动物相关的提及内容、实时翻译语音,以及提醒用户注意坐姿等。
目前,Thinking Machines已在官网发布了关于交互模型的详细说明。不过,用户暂时还无法亲自体验该功能;公司计划在"未来几个月内"开放"有限研究预览版",并预计于"今年晚些时候"进行更大范围的公开发布。
Murati于2025年2月离开OpenAI后创立了Thinking Machines。然而,这家AI实验室近期面临较为严峻的人才流失问题,多名核心成员相继跳槽至Meta,甚至有人重返OpenAI。
Q&A
Q1:Thinking Machines的交互模型和普通AI模型有什么区别?
A:普通AI模型以单线程方式运作,需要等用户完成输入后才开始处理,生成内容期间也无法接收新信息。而Thinking Machines的交互模型可以同时持续接收音频、视频和文本,并实时思考和响应,更接近人与人之间自然协作的方式,大幅减少了人机交互的信息传递瓶颈。
Q2:Thinking Machines的交互模型目前可以使用吗?
A:目前还不能公开使用。Thinking Machines计划在未来几个月内开放有限研究预览版,并预计在2025年晚些时候进行更大范围的公开发布。感兴趣的用户可以关注其官网获取最新动态。
Q3:Mira Murati为什么离开OpenAI去创立Thinking Machines?
A:文章中未详细说明Murati离开OpenAI的具体原因,仅提到她于2025年2月离开OpenAI后创立了Thinking Machines。目前该公司专注于开发可实时多模态交互的AI技术,但公司也面临核心人才流失的挑战,部分成员已跳槽至Meta或重返OpenAI。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。