在OpenAI的GPT-3开启基础模型时代之前,各公司通常从头构建专用的自然语言处理模型,并针对特定任务收集大量数据进行训练。如今,大多数企业会以GPT系列、Claude或Llama等通用模型为起点,再通过微调或提示词工程来满足自身需求。
General Intuition的CEO皮姆·德·维特认为,具身AI也将遵循类似的发展路径。他主张,与其耗费大量资源收集真实世界数据来构建专用机器人模型,行业更应聚焦于高质量数据集的建设,以此训练出能够跨越多种环境、迁移运动与交互直觉的基础模型。
"目前很多公司正在开展大量专项工作,将精力集中在特定形态、特定环境和特定机器人上。"德·维特在近期接受TechCrunch《Equity》播客采访时表示。
他认为,随着General Intuition正在研发和部署的通用模型逐步涌现,上述大量专项工作将很快变得多余。
"模型本身的泛化能力就是产品所在,"他说,"正是因为模型具备了对空间与时间的基础推理能力,人们才会停止收集数十万乃至数百万小时的真实世界数据。现实情况是,你只需要几分钟的数据就够了。"
General Intuition在数百万小时的电子游戏数据上训练出了自己的基础模型,训练数据涵盖玩家操作手柄按键的时机与方式等信息。德·维特与General Intuition的主要投资人维诺德·科斯拉均认为,动作数据是培养类人空间-时间推理直觉的关键所在。
该公司上月完成了一轮3.2亿美元的融资,估值达23亿美元,正是建立在这一核心理念之上。目前,公司已证明其模型不仅能连续数小时运行电子游戏,还能在仅经过8分钟真实机器人数据微调后,驱动一台四足机器人完成任务。
"机器人仅凭前置摄像头、不借助其他传感器,就能在有人员走动、动态物体不断介入的办公环境中实现零样本泛化,这让我们自己都感到非常惊讶,"德·维特说,"我认为这预示着未来的发展方向。"
General Intuition的终极目标并非自主研发机器人,而是成为实体AI领域的基础模型提供商,为其他机器人公司搭建各自产品提供底层支撑。正如德·维特所说:"我们不会去做自动驾驶汽车公司,但我们会让下一个想做自动驾驶汽车公司的人,轻松10倍。"
Q&A
Q1:General Intuition的基础模型是用什么数据训练的?
A:General Intuition的基础模型主要基于数百万小时的电子游戏数据进行训练,包括玩家操作手柄按键的时机与方式等动作信息。公司及其投资人认为,这类动作数据是培养类人空间-时间推理直觉的核心。正是依托这一数据策略,模型仅需8分钟的真实机器人数据微调,便能驱动四足机器人完成任务。
Q2:General Intuition的商业模式是什么?它打算自己造机器人吗?
A:General Intuition并不打算自主制造机器人,而是致力于成为实体AI领域的基础模型提供商,为其他机器人公司提供底层通用模型,让各家企业可以在此基础上开发自己的产品。CEO德·维特将其类比为:不做自动驾驶汽车公司,而是让别人造自动驾驶汽车变得更容易。
Q3:General Intuition最新一轮融资的规模和估值是多少?
A:General Intuition上月完成了3.2亿美元的融资,融资后公司估值达到23亿美元。此轮融资的核心逻辑是:通用基础模型能够大幅降低机器人行业对海量真实世界数据的依赖,从而推动整个具身AI领域进入新的发展阶段。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。