测量研究:arXiv 新投稿约三分之一文本特征与 AI 撰写一致,计算机科学领域达 65%
AI 文本检测工具 unslop 发布一项测量研究:对 12,750 篇 arXiv 论文的全文(而非摘要)打分后,约三分之一的新投稿在文本特征上与机器撰写一致。研究采样十个学科分组、每月每领域约 25 篇,时间跨度从 2023 年 1 月到 2026 年 7 月,另加 2021–2022 年八个对照月份;每篇取 v1 版 PDF,避免后期修订把「现代文本」泄漏回早期时间槽。
方法上的关键设计是假阳率锚定:针对「N% 的 X 已经是 AI」类标题的通病(检测器本身会误伤真人写作),研究团队把检测阈值校准到 pre-ChatGPT 论文仅 0.4% 被判为机器撰写——该阈值下可清掉 99.6% 的真实 pre-LLM 科学文本,同时召回 85% 的 AI 学术文本。所有报告数字都带 bootstrap 95% 置信区间。
分学科结果差异悬殊(近 12 个月被判机器撰写的比例,对照列为 2021–2022 年同领域基线):计算机科学 65.0%(基线 0.2%)、定量生物学 56.3%、电子工程与系统 51.3%、经济与金融 47.0%、应用物理 34.0%、统计学 31.3%、凝聚态 24.0%、高能物理 14.0%、天体物理 10.7%、数学仅 0.7%。作者明确指出上升最多的领域并非基线最高的领域,「起点高」解释不了增长。
研究同时坦承局限:各学科对照组只有 200 篇,0.4% 的假阳率意味着整个 2000 篇对照里只有约 8 篇被误标,单领域的对照率只是近似值;数学领域的 0.7% 尤其难解读——大量使用模型辅助起草的数学论文可能因为行文「超出检测器分布」而得低分,低分既可能是采用率低、也可能是检测器在该文体上失效,数据本身无法区分这两种解释。
这项研究为「AI 正在多深地渗入学术写作」提供了一组少见的带假阳率校准的量化参照。值得注意的是它测量的是「文本特征与 AI 撰写一致」,既包括直接用模型代写、也包括深度润色改写,不等于「三分之一的论文由 AI 独立完成」;但作为时间序列信号(2021→2026 持续爬升),学术出版的工作流变化已经相当明确。