非营利组织Creative Commons曾引领许可证运动,允许创作者在保留版权的同时分享作品,如今正为AI时代做准备。该组织周三宣布启动新项目CC signals,允许数据集持有者详细说明其内容如何被机器重用,例如用于训练AI模型的情况。
这一理念旨在平衡互联网的开放性和AI对更多数据的持续需求。
Creative Commons在博客文章中解释,持续的数据提取可能侵蚀互联网的开放性,导致实体将其网站围墙化或设置付费墙,而非共享数据访问权限。
CC signals项目旨在提供法律和技术解决方案,为数据控制者和AI训练使用者之间的数据集共享提供框架。
随着企业努力调整政策和服务条款,要么限制AI在其数据上进行训练,要么解释在何种程度上将用户数据用于AI相关目的,对此类工具的需求正在增加。
例如,X最初允许第三方在其公共数据上训练模型,后来又撤销了这一变更。Reddit使用其robots.txt文件(用于告知自动网络爬虫是否可以访问其网站)来限制机器人抓取其数据用于AI训练。Cloudflare正在寻求对AI机器人抓取收费的解决方案,以及混淆它们的工具。开源开发者也构建了工具来减慢和浪费那些不尊重"禁止爬取"指令的AI爬虫资源。
CC signals项目提出了不同的解决方案:一套提供多种法律执行力的工具,但都具有伦理权重,类似于今天覆盖数十亿在线开放许可创意作品的CC许可证。
Creative Commons首席执行官Anna Tumadóttir在声明中表示:"CC signals旨在维持AI时代的公共资源。正如CC许可证帮助构建开放网络一样,我们相信CC signals将有助于塑造基于互惠原则的开放AI生态系统。"
该项目目前刚开始成形。早期设计已在CC网站和GitHub页面发布。该组织正积极征求公众反馈,计划于2025年11月进行alpha版本(早期测试)发布。还将举办一系列市政厅会议收集反馈和问题。
好文章,需要你的鼓励
很多人担心被AI取代,陷入无意义感。按照杨元庆的思路,其实无论是模型的打造者,还是模型的使用者,都不该把AI放在人的对立面。
MIT研究团队提出递归语言模型(RLM),通过将长文本存储在外部编程环境中,让AI能够编写代码来探索和分解文本,并递归调用自身处理子任务。该方法成功处理了比传统模型大两个数量级的文本长度,在多项长文本任务上显著优于现有方法,同时保持了相当的成本效率,为AI处理超长文本提供了全新解决方案。
谷歌宣布对Gmail进行重大升级,全面集成Gemini AI功能,将其转变为"个人主动式收件箱助手"。新功能包括AI收件箱视图,可按优先级自动分组邮件;"帮我快速了解"功能提供邮件活动摘要;扩展"帮我写邮件"工具至所有用户;支持复杂问题查询如"我的航班何时降落"。部分功能免费提供,高级功能需付费订阅。谷歌强调用户数据安全,邮件内容不会用于训练公共AI模型。
华为研究团队推出SWE-Lego框架,通过混合数据集、改进监督学习和测试时扩展三大创新,让8B参数AI模型在代码自动修复任务上击败32B对手。该系统在SWE-bench Verified测试中达到42.2%成功率,加上扩展技术后提升至49.6%,证明了精巧方法设计胜过简单规模扩展的技术理念。