Anthropic近期开展了一项实验,构建了一个模拟分类信息市场,让AI智能体分别扮演买家与卖家角色,双方在这一平台上达成真实商品的实际交易。
Anthropic坦承,这次名为"Project Deal"的测试仅是一项"小规模试验性实验,参与者均为自愿报名的内部员工"。共有69名Anthropic员工参与其中,每人获得100美元预算(以礼品卡形式发放),用于向同事购买商品。
尽管如此,Anthropic表示对"Project Deal的运行成效感到惊喜"——本次实验共促成186笔交易,交易总金额超过4,000美元。
据悉,Anthropic实际上构建了四个独立的市场环境,分别配备不同的AI模型进行测试:其中一个为"真实"市场(所有用户均由公司最先进的模型代理,且实验结束后交易结果得到实际兑现),另外三个则用于学术研究目的。
Anthropic指出,当用户由更先进的模型代理时,他们往往能获得"客观上更优的交易结果"。然而,用户普遍未能察觉到这种差距,这引发了对"智能体质量差异"问题的关注——处于劣势的一方很可能并未意识到自己吃了亏。
此外,实验结果还显示,用户在初始阶段给予智能体的指令,对最终的成交概率和议价结果并无明显影响。
Q&A
Q1:Project Deal实验是什么?它是如何运作的?
A:Project Deal是Anthropic开展的一项内部实验,旨在测试AI智能体之间的商业交易能力。实验构建了一个模拟分类信息市场,让智能体分别代表买家和卖家进行真实商品交易。共69名员工参与,每人获得100美元礼品卡预算用于向同事购买商品。整个实验共达成186笔交易,总金额超过4,000美元。
Q2:使用更先进的AI模型代理交易,结果会有什么不同?
A:根据Anthropic的实验结果,由更先进的AI模型代理的用户能够获得客观上更好的交易结果。但值得关注的是,处于劣势的用户往往并未察觉到这种差距,这意味着"智能体质量差异"可能在用户不知情的情况下影响交易公平性,形成隐性的不对等局面。
Q3:用户给智能体的初始指令会影响交易结果吗?
A:根据Project Deal的实验数据,用户最初给予智能体的指令对成交概率和最终议价价格并没有显著影响。也就是说,无论用户如何设定初始交易策略,智能体在实际谈判中的表现差异并不明显,这一结论对于理解智能体自主决策能力具有一定参考价值。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。