方法

数据收集 为了更好地了解人工智能创作的内容在互联网上的流行情况,我们使用了从 Common Crawl 采样的网页数据,这是一个非营利组织,收集和维护可追溯到 2008 年的大型网络档案。Common Crawl 大约每月一次,完成对可观察互联网的“抓取”,创建快照 [...]

来源:皮尤研究中心信息

数据收集

为了更好地了解人工智能创作的内容在互联网上的流行情况,我们使用了从 Common Crawl 采样的网页数据。Common Crawl 是一个非营利组织,收集并维护着可追溯到 2008 年的大型网络档案。Common Crawl 大约每月一次完成对可观察互联网的“抓取”,创建该时间点的网络快照。要包含在公共爬网快照中,页面必须可公开访问。具有付费墙或需要登录才能访问内容的网站在这些样本中可能代表性不足。

我们从 2021 年 1 月至 2026 年 7 月期间创建的 49 个爬网中,每次随机抽取了 10,000 个英语页面,总计 490,000 个页面。对于每个样本页面,我们收集了 Common Crawl 的包含完整 HTML 的 WARC(Web ARChive)记录,以及仅包含页面正文的 WET(WARC 封装文本)文件,不包括任何 HTML 代码、图像或其他媒体。

给定爬网示例中大约 10% 到 15% 的网页在其 HTML 代码中包含发布日期字段。我们记录了可用的这些日期,并使用它们来确定自 2022 年 11 月 30 日 ChatGPT 公开发布以来,每次抓取的哪些页面已发布。具有可检测发布日期的页面子集不是网络的随机子集,因此我们的 ChatGPT 后估计反映了人工智能作者在过时内容而不是整个网络中的普遍性。然而,我们在本次分析中的发现与相关研究大致一致,包括“人工智能生成的文本对互联网的影响”(Dolezal 等人,2026),该研究使用互联网档案馆的数据确定 35% 的新发布网站包含人工智能生成或人工智能辅助的文本。虽然得出的方法不同,但这一发现可以与我们的发现进行比较,即 2026 年 7 月抓取的 ChatGPT 发布日期后的页面中有 35% 显示出 AI 作者身份的迹象。

检测 AI 作者身份