我们都曾感觉到正在阅读的内容可能是由大语言模型生成的——但要准确判断却非常困难。去年有几个月,大家都认为"delve"或"underscore"这类特定词汇能暴露AI模型的身份,但证据并不充分,随着模型变得更加复杂,这些标志性词汇也变得更难追踪。
但事实证明,维基百科的编辑们在标记AI生成文本方面已经变得相当擅长——该团队公开发布的"AI写作迹象"指南是我发现的最佳资源,能帮助确认你的怀疑是否有根据。(感谢诗人Jameson Fitzpatrick在X平台上分享了这份文档。)
自2023年以来,维基百科编辑一直致力于处理AI提交的内容,他们称这个项目为"AI清理项目"。由于每天有数百万次编辑提交,有大量材料可供分析,以典型的维基百科编辑风格,该团队制作了一份既详细又有充分证据支撑的实地指南。
首先,该指南证实了我们已知的事实:自动化工具基本无用。相反,指南重点关注在维基百科上罕见但在整个互联网上常见的习惯用法和措辞(因此在模型的训练数据中很常见)。根据指南,AI提交的内容会花大量时间强调某个主题为什么重要,通常使用"关键时刻"或"更广泛的运动"等通用术语。AI模型还会花很多时间详细描述次要媒体报道,以使主题显得值得关注——这是你在个人简历中会期待看到的内容,但不是来自独立来源的。
指南标出了一个特别有趣的怪癖,即在尾部条款中含糊地声称重要性。模型会说某个事件或细节"强调了某事的重要性",或"反映了某个一般想法的持续相关性"。(语法专家会知道这是"现在分词"。)这有点难以准确定义,但一旦你能识别它,你会发现它无处不在。
还有一种倾向于使用模糊的营销语言,这在互联网上极其常见。风景总是优美的,景色总是令人惊叹的,一切都是干净现代的。正如编辑们所说,"这听起来更像电视广告的文字稿。"
这份指南值得完整阅读,但我看完后印象深刻。在此之前,我会说大语言模型的写作风格发展太快,难以确定。但这里标记的习惯深深嵌入在AI模型的训练和部署方式中。它们可以被伪装,但很难完全消除。如果公众在识别AI文本方面变得更加精明,可能会产生各种有趣的后果。
Q&A
Q1:维基百科是如何处理AI生成内容的?
A:自2023年以来,维基百科编辑启动了"AI清理项目",专门处理AI提交的内容。由于每天有数百万次编辑提交,编辑们积累了大量经验,并制作了详细的"AI写作迹象"指南来帮助识别AI生成的文本。
Q2:AI写作有哪些典型特征?
A:AI写作通常会过度强调主题重要性,使用"关键时切"等通用术语;详细描述次要媒体报道以显得重要;频繁使用现在分词结构如"强调重要性";倾向于使用模糊的营销语言,如"优美的风景"、"令人惊叹的景色"等。
Q3:自动化工具能有效检测AI写作吗?
A:根据维基百科指南,自动化工具基本无用。更有效的方法是识别AI模型的写作习惯和措辞特点,这些特征源于模型的训练数据,虽然可以被伪装但很难完全消除。
好文章,需要你的鼓励
英国国家医疗服务(NHS)正将无人机纳入常规医疗物流体系。自今年2月起,无人机每天在雷恩斯公园和圣乔治医院之间运送血液等诊断样本,飞行仅需3分钟,比公路运输快约85%,且碳排放减少高达98%。目前已有逾2000名患者受益。NHS计划将该服务扩展至圣赫利尔、克罗伊登等多家医院,最终惠及约180万名患者。该网络由英国医疗初创公司Apian与谷歌旗下Wing合作运营。
AgentLens是Explyt公司联合俄罗斯学术机构开发的AI编程助手评测基准,通过分析完整人机交互轨迹而非仅看最终结果,从五个维度评估代码智能体的真实表现。
边缘AI计算厂商Aetina宣布,将在其DeviceEdge AIE-KT风冷系列和新款AIE-PT无风扇平台上支持英伟达全新Jetson T3000和T2000模块。T3000基于Blackwell GPU,最高提供865 FP4 TFLOPS算力,功耗70W;T2000则提供400 FP4 TFLOPS,面向视觉AI代理和自主移动机器人等场景。两款模块预计2027年第一季度上市,支持Nemotron、Cosmos 3等英伟达AI软件生态。
韩国梨花女子大学提出Splash框架,通过识别AI模型中的"休眠参数"并只在其中训练触觉能力,让小型多模态AI在学会感知材质触感的同时,完整保留原有视觉语言推理能力。