《纽约时报》与《每日新闻》近日指控OpenAI在版权诉讼中蓄意隐瞒证据。这场诉讼已持续两年,核心争议在于OpenAI是否通过使用《纽约时报》的内容训练其生成式AI模型,并在用户输出中复现相关新闻报道,从而侵犯了版权。
在整个诉讼过程中,OpenAI一贯声称自己无力搜索自有训练数据集,同时以技术负担过重和用户隐私保护为由,拒绝提供大规模的ChatGPT对话记录,并表示相关日志需经过检索、处理和去标识化处理。两家媒体申请获取上述数据,目的是核实其受版权保护的新闻内容是否出现在OpenAI的训练数据集中,以及ChatGPT在多大程度上使用或复现了这些内容。
然而,在法院今年4月强制要求进行的一次证词陈述中,OpenAI数据隐私工程师维尼·摩纳哥据称披露,OpenAI此前已对训练数据集进行过内部搜索,并专门检索了受版权保护的新闻作品。
摩纳哥的证词还显示,早在《纽约时报》提起诉讼之前,OpenAI就已建立了一个包含约7800万条去标识化ChatGPT对话记录的内部数据库,用于评估自身的版权侵犯程度。此外,在诉讼提起后不久,OpenAI据称还在名为"Project Giraffe"的工具集中部署了一套"布隆"过滤器,专门用于检测并记录模型输出中的内容复现情况。
这两项披露尤为关键。原告方最初要求OpenAI提供1.2亿条对话日志样本,经过谈判后被压缩至2000万条。去年12月,OpenAI终于向法院提交了该样本,但据称其中包含大量删改,法院认定该样本"无法使用"。原告还指控OpenAI在诉讼提起后删除了数十亿条ChatGPT输出内容,直接违反了法院的证据保全令,并在所提供的样本中替换了数百万条日志。
换言之,原告方认为,OpenAI将本已掌握的信息设置了不必要的获取障碍。
原告首席律师伊恩·B·克罗斯比在声明中表示:"如果OpenAI真心认为使用我方客户的新闻内容属于合理合法行为,它就不会刻意隐瞒这一事实。"
目前,《纽约时报》与《每日新闻》正请求法官对OpenAI涉嫌藏匿证据、干扰证据开示程序的行为予以制裁。具体诉求包括:禁止OpenAI将2000万条对话日志样本作为证据使用,理由是该样本不可信;要求法院将"ChatGPT日志将显示对原告内容存在大量复现"这一事实认定为既成事实;禁止OpenAI主张其提供的对话日志未体现重大内容复现;并要求OpenAI承担原告方追查上述证据所产生的诉讼费用。
对此,OpenAI发言人德鲁·普萨特里否认了上述指控,反指《纽约时报》在案件逐渐走弱之际,试图入侵普通用户的私人对话记录。
"随着《纽约时报》案件的证据支撑日益薄弱,他们已被迫撤销对我方的部分指控,却仍执意试图侵犯与本案毫无关联的普通用户的隐私权,包括提出这些明显失实的指控。"普萨特里表示,"我们将继续捍卫用户隐私,以及历经检验的合理使用原则。"
Q&A
Q1:《纽约时报》为何指控OpenAI隐匿证据?
A:《纽约时报》与《每日新闻》在版权诉讼中发现,OpenAI曾声称无力搜索自有训练数据集,但其数据隐私工程师在法院强制证词中承认,公司早已对训练数据进行过内部检索,并建立了约7800万条去标识化对话记录的数据库。此外,OpenAI还被指在提交的2000万条日志样本中进行大量删改,并在诉讼提起后删除数十亿条ChatGPT输出内容,违反了法院的证据保全令。
Q2:原告方向法院提出了哪些具体制裁请求?
A:原告方请求法院禁止OpenAI将2000万条对话日志样本作为证据使用;要求法院认定ChatGPT日志存在大量复现原告内容的事实;禁止OpenAI主张其提供的日志未体现重大内容复现;并要求OpenAI承担原告因追查证据而产生的全部诉讼费用。
Q3:Project Giraffe和布隆过滤器在这起诉讼中有什么意义?
A:Project Giraffe是OpenAI内部的一套工具集,其中包含一个"布隆"过滤器,专门用于检测和记录模型输出中的内容复现情况。由于OpenAI此前声称无法追踪此类信息,该工具的存在直接与其在诉讼中的抗辩立场相矛盾,成为原告方指控其隐匿证据的重要依据之一。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。