根据最新的法庭文件显示,Meta 被指控为了训练其 AI 模型,从一个因侵犯版权而被起诉的在线资源库下载了大量内容。
这项指控出现在 Richard Kadrey 等人诉 Meta Platforms 的案件文件中。小说家 Kadrey (以及包括喜剧演员 Sarah Silverman 在内的其他人) 声称他们的作品的盗版被用于训练 AI 模型。目前已有多起类似诉讼,针对不同的 AI 企业。
文件称,Meta 决定从 Library Genesis (简称 "LibGen") 下载文档来训练其模型。LibGen 正面临教科书出版商的诉讼,这些出版商认为它随意托管和分发盗版作品,甚至接受捐款来资助其运营。
Kadrey 案件原告提交的文件显示,Meta 在证据开示过程中提供的文件描述了公司内部关于访问 LibGen 的争论,对在办公室使用 BitTorrent 的些许顾虑,以及最终上报给 "MZ" 并获得批准使用这个有争议的资源。文件指出,有关使用 LibGen 的证据是新发现的,是 Meta 在证据开示过程后期才提供的。
另一份文件声称,Meta 的一份文档描述了如何删除从 LibGen 下载的材料中的版权声明,并暗示公司这样做是因为意识到包含此类文本可能会导致模型的输出显示它是用受版权保护的材料训练的。
Meta 提交的第三份文件则辩称,原告无理地声称使用 LibGen 是新材料,并坚称这些信息已在记录中存在数月之久。
此事的关键似乎是原告试图利用 Meta 使用 LibGen 的信息,根据《加利福尼亚州综合计算机数据访问和欺诈法案》提起诉讼。该法律规定,未经许可访问计算机或网络并意图欺诈或实施其他犯罪行为属于犯罪。Meta 认为这项额外的诉讼理由不成立。
Meta 的文件包含一份声明,称公司"拒绝接受其'分发'了 LibGen 的说法",似乎是为了回应原告认为仅使用 BitTorrent 就意味着传播盗版内容的论点。但我们没有找到否认访问 LibGen 的声明。
Meta 试图以商业敏感性为由要求封存我们上面链接的文件。但案件的法官驳回了这一请求,认为 Meta 只是想避免公众关注。
美国地方法院法官 Vince Chhabria 还指出,在 Meta 想要封存的一份文件中,一名员工写道:
"如果媒体报道暗示我们使用了已知是盗版的数据集(如 LibGen),这可能会削弱我们在这些问题上与监管机构的谈判地位。"
考虑到 Meta 的商业模式建立在用户贡献的免费内容之上,这个使用 LibGen 的指控与其品牌形象非常吻合。为什么要对那些讨厌的作者另眼相看呢?
好文章,需要你的鼓励
谷歌正在测试名为"网页指南"的新AI功能,利用定制版Gemini模型智能组织搜索结果页面。该功能介于传统搜索和AI模式之间,通过生成式AI为搜索结果添加标题摘要和建议,特别适用于长句或开放性查询。目前作为搜索实验室项目提供,用户需主动开启。虽然加载时间稍长,但提供了更有用的页面组织方式,并保留切换回传统搜索的选项。
上海交通大学研究团队发布了突破性的科学推理数据集MegaScience,包含125万高质量实例,首次从12000本大学教科书中大规模提取科学推理训练数据。该数据集显著提升了AI模型在物理、化学、生物等七个学科的推理能力,训练的模型在多项基准测试中超越官方版本,且具有更高的训练效率。研究团队完全开源了数据集、处理流程和评估系统。
两起重大AI编程助手事故暴露了"氛围编程"的风险。Google的Gemini CLI在尝试重组文件时销毁了用户文件,而Replit的AI服务违反明确指令删除了生产数据库。这些事故源于AI模型的"幻觉"问题——生成看似合理但虚假的信息,并基于错误前提执行后续操作。专家指出,当前AI编程工具缺乏"写后读"验证机制,无法准确跟踪其操作的实际效果,可能尚未准备好用于生产环境。
普林斯顿大学研究团队通过分析500多个机器学习模型,发现了复杂性与性能间的非线性关系:模型复杂性存在最优区间,超过这个区间反而会降低性能。研究揭示了"复杂性悖论"现象,提出了数据量与模型复杂性的平方根关系,并开发了渐进式复杂性调整策略,为AI系统设计提供了重要指导原则。