我们如何测量 arXiv 上 AI 写作的比例,以及该测量在何处失效
超过 30% 提交至 arXiv 的论文读起来像 AI 写的。我们对 12,750 篇 arXiv 论文的全文进行了评分,发现约三分之一的新论文读起来像机器写的。以下是方法、结果以及对局限性的坦诚说明。 方法论 · 5 分钟阅读 · 2026
被标记为机器撰写的新 arXiv 论文占比,2021 至 2026 年,阈值校准至 ChatGPT 出现前论文的误报率为 0.4%。八个灰色点为预 LLM 控制月份;带状区域为 bootstrap 95% 置信区间。
按学科划分的被标记为机器撰写的论文占比,截至 2026 年 7 月的 12 个月内(每学科约 300 篇论文)。
误报基准
有一种标题套路是“N% 的 X 现在是 AI 写的”,大多数不值得一读,因为该数字背后的检测器也会标记一部分真正的人类写作。如果某个工具标记了 40% 的新论文为机器撰写,但也标记了 20% 在 ChatGPT 存在之前撰写的论文,那么真正的故事是那没人提及的 20%。因此,我们围绕这一异议构建了研究。
我们的检测器(在此描述)针对学术写作进行了校准;在 0.4% 的误报率下,它能排除 99.6% 的真实预 LLM 科学文本,并识别出 85% 的 AI 学术文本。我们将这一误报率作为基准。我们选取了 2021 年和 2022 年提交的论文(ChatGPT 出现之前),将其视为真实人类写作,并设定标记阈值,使得恰好 0.4% 的论文被触发。这条线就是基准。我们报告的每个数字都是超过该阈值的论文占比,而根据设计,真实预 LLM 写作在该阈值下的比例为 0.4%。
ChatGPT 出现前的年份因此充当了内置对照组:如果增长是检测器的人为产物,那么 2021 年和 2022 年的标记率会与 2026 年一样高。第一张图显示并非如此。
我们测量了什么
我们从 2023 年 1 月至 2026 年 7 月,每月每学科约 25 篇论文,抽样了十个学科组,加上 2021 年和 2022 年的八个控制月份,共计 12,750 篇论文。每篇论文我们提取了版本 1 的 PDF,因此 2026 年修订的论文不会将现代文本泄露回其 2023 年的位置。我们对全文正文进行评分,而非摘要,因为摘要会低估信号:我们见过同一篇论文的摘要评分低于 20%,而正文评分超过 70%。每个报告的数字都带有 bootstrap 95% 置信区间。
结果
被标记的占比在 2021 年和 2022 年稳定在 0.4%,在 ChatGPT 出现后的几个月内开始上升,并在两个波次中攀升至最近完整季度的约 32%,在 2026 年初达到近 39% 的峰值。学科之间的差异很大,表格和第二张图展示了这一点。以下数值是截至 2026 年 7 月的 12 个月内各学科的被标记占比,以及其预 LLM 控制水平。
| 学科组 | 预 LLM 控制 | 近期被标记占比 | 95% 置信区间 | |--------|------------|----------------|--------------| | 计算机科学 | 0.2% | 65.0% | [59.3, 70.3] | | 定量生物学 | 3.5% | 56.3% | [51.0, 61.7] | | 电气工程与系统 | 1.7% | 51.3% | [46.0, 57.0] | | 经济学与金融 | 2.5% | 47.0% | [41.3, 52.7] | | 应用物理学 | 1.3% | 34.0% | [29.0, 39.7] | | 统计学 | 1.8% | 31.3% | [26.0, 36.7] | | 凝聚态物理 | 0.0% | 24.0% | [19.3, 29.0] | | 高能物理 | 0.5% | 14.0% | [10.0, 18.0] | | 天体物理学 | 0.0% | 10.7% | [7.3, 14.3] | | 数学 | 0.0% | 0.7% | [0.0, 1.7] |
计算机科学领先,约 65%。数学最低,接近 0.7%,局限性部分解释了为何其低值难以解读。控制列是各学科 2021 至 2022 年在三种灵敏度设置下的平均标记率;增长最快的学科并非预 LLM 控制水平最高的学科,因此较高的起点并不能解释增长。
局限性
控制样本量。 每个学科的预 ChatGPT 控制样本为 200 篇论文。在 0.4% 的标记率下,整个 2,000 篇论文的控制样本中仅有八篇被标记,分散在十个学科中,因此单阈值下的每学科控制率较为粗略。汇总基准得到了良好估计,也是本研究锚定的基础,但每学科控制水平仅为近似值,且更大的控制样本也无法解决这一问题:要将每学科的标记率精确到百分之零点几,每个学科需要数千篇控制论文,而 2023 年之前的 arXiv 数据量无法满足。
低分可能表明采用率低或检测器存在盲区。 数学是最明显的案例。数学论文以符号和定理证明结构为主,一旦移除公式和参考文献,剩余的散文部分稀疏且与检测器所训练的科学英语不同。一篇大量借助模型辅助撰写的数学论文可能得分较低,因为其散文部分超出了检测器的分布范围,因此数学领域的低分是证明论文由人类撰写的薄弱证据。这一结果与两种截然不同的解释一致:采用率较低,或检测器在该语域中的灵敏度降低,而本数据无法区分二者。那些最符合分布假设的领域(即散文密集的领域)也是增长最快的领域,因此这一混淆因素并不能解释总体趋势。但在低分学科中,排名应被视为采用率的下限。
检测器覆盖范围。 检测器对某些生成器比另一些更敏感,我们无法针对作者实际使用的确切、私有的模型和提示组合进行评估。不完整的覆盖范围会降低标记率,因此报告的流行率是下限:真实占比至少与我们测量的结果相当。检测器的详细说明报告了每个生成器的性能。
标记不等于作者身份。 检测器评估的是文本是否读起来像机器撰写,基于校准后的概率和已知的错误率。它无法区分轻度编辑的文档与完全生成的文档,且单一分数绝不足以指控某个特定个人。我们报告的是类似机器写作的流行率,这包括重度 AI 辅助编辑。
试试看
该检测器运行成本低廉,我们也不从中获利。你可以在此免费对任何 arXiv 论文进行测试,并在此测试你自己的文本。