从字面上看,人工智能编写的内容无处不在。
根据皮尤研究中心周四发布的一项研究,现在十分之一的英文网页显示出由人工智能编写的明显迹象。将样本缩小到仅自 2022 年 11 月 ChatGPT 推出以来发布的页面,份额跃升至 35%。

研究人员从 Common Crawl 网络档案中提取了 2021 年 1 月至 2026 年 7 月的大约 490,000 个页面,然后通过 AI 检测模型 Open Pangram 运行文本后得出了这一结果。
AI指纹分布不均匀。 .com 域上的页面显示人工智能作者身份的迹象大约是 .edu 或 .gov 域的 10 倍,两者均接近 1%,大约是 .org 网站上 4.6% 的两倍。
2021 年,所有四种域名类型看起来几乎相同。
皮尤研究中心如何发现这些机器
该检测器不会标记任何单个单词或短语,而是权衡大批量文本的统计模式。但自 2023 年以来,一些个人说法变得更加普遍:通常的破折号(就像我们自己喜欢的那样)现在出现的频率大约是原来的两倍,牛津逗号上升了 63%,人工智能喜欢的单词,如“delve”、“interplay”和“testament”的出现频率增加了一倍多。
自 2023 年以来,“负并行”(例如“这不仅仅是 X,这是 Y”之类的结构)几乎增加了两倍,但皮尤研究中心指出,这种情况总体上仍然很少见。 Decrypt 之前也曾追踪过这些相同的线索,韦氏词典于 12 月将其正式公布,并将“slop”命名为年度词汇。
皮尤小心地指出了这里的局限性:检测模型可能会在两个方向上对各个页面进行错误分类,而“人工智能作者身份的重要迹象”并不意味着页面完全由机器编写——大量文本可能是人工智能辅助的,而不是直接由人工智能生成的。
Open Pangram 来自 Pangram Labs,其探测器也在另一项研究中出现,发现今年美国报纸文章中约有 9% 是人工智能生成的文本,包括《纽约时报》等媒体的观点页面。
也就是说,随着时间的推移,人工智能检测可能会变得更容易,这不是因为模式,而是因为底层技术。像 Anthropic 这样的大型人工智能公司已经在研究模型级文本指纹,这将使人工智能文本易于识别,同时最大限度地减少错误。
域差距跟踪谁在发布以及为什么发布。学术和政府网站经历编辑审查、机构签字和较慢的出版周期; .com 域名包括从新闻编辑室到联属营销内容农场的所有内容,其页面制作速度是人类编辑无法承受的。
从规模上看,趋势线是陡峭的:.com 人工智能作者率从 2021 年 1 月的约 1% 攀升至五年后(仅 2026 年 1 月)的 9.35%。