有人编录了 13,000 种 AI 写作暴露自己的方式

写作分析公司 Graphite 的一项研究,为所有经常阅读机器生成文本的人做了一件有用的事:它不再猜测,而是开始计数。
团队选取了 10,000 篇在 ChatGPT 出现之前发表的文章,让 AI 模型重写它们,然后对比这两批文本。结果得到了一份约 13,000 个短语的清单,这些短语在 AI 版本中出现的频率至少是人类原文中的两倍。不是整句,而是短语。是模型在填充内容时习惯性使用的一些小小的语言套路。
破绽转移了,但没有消失
这一发现显而易见的部分是清单本身。更有意思的是它在汇编过程中发生的变化。
Graphite 的首席 AI 官 Greg Druck 表示,趋势线同时朝两个方向延伸。像破折号这样更早、更显眼的标记已经被训练得少了很多,因为开发者注意到了它们并着手处理。但当一组口头禅被磨平后,另一组就会填补空白。这份清单并没有随着时间变短,而是变得更不熟悉。
这正是其令人不安的核心。人们总把 AI 检测当作一个非此即彼的已解决问题。要么检测器有效,能立刻识别出模型;要么它们彻底失灵、毫无用处。现实更像是侵蚀。表面被擦洗,底层的纹理仍在。
两家实验室,两个方向
这项研究被引用最多的一句话,是两家厂商之间的分化。Druck 观察到,Anthropic 的 Claude 模型在一代代更新中,正越来越接近标准的人类词频分布。而用同样的衡量标准看,OpenAI 的 GPT 模型则一直在进一步偏离。
对此应保持应有的谨慎。这只是某家公司的指标,基于它自己的对比数据集,衡量的是它自己对“像人”的定义。词频分布并不等于真相。一个模型可以完全落在人类平均值上,却仍然写出没人会写的句子;一个模型也可以偏离分布,同时写出真正优秀的内容。
尽管如此,方向仍值得注意,因为它与一种你能感受到的差异相吻合。有些模型读起来像一位被要求避免陈词滥调的谨慎写作者。另一些则读起来像一个非常自信的助手,吸收了某种机构文风后就再不肯放手。
为什么短语层面的破绽比句子层面的更重要
大多数人最初接触 AI 检测,是通过整句的破绽。开场铺垫。结尾工整的总结。无论内容有没有三个部分都会出现的三段式列表。
模型变得更擅长不做这些事,至少在好好要求它们时是这样。更难磨掉的是连接组织。一个段落与下一段缝合的方式。那种条件反射式的平衡倾向:每一个论点都要配上一个与之对应的平衡砝码,不管证据是否支持。对抽象名词而非具体名词的偏爱。
这些东西能在重写指令下存活,因为它们不是模型有意识遵循的规则。它们是其学习分布的形态。你可以让模型停止使用某个词。但要让它停止以某种特定节奏思考,则难得多。

这份短语清单还就平均值提出了一个更微妙的观点。破绽并不是均匀分布的。一个模型可能某个短语用得比人多得多,另一个又用得更少,而这种模式只有在上千次比较中才会显现。没有人类读者会注意到这种总体规律。读者只会注意到某个句子感觉不对劲,却很少知道为什么。统计能看到的东西和人能说清楚的东西之间的这道鸿沟,正是靠肉眼做好检测如此困难的原因。
它滋养的检测市场
这样一份清单有显而易见的商业后果。任何销售 AI 检测的公司现在都有了一套新鲜、具体的特征可供训练,而任何销售 AI 写作的公司现在也有了一份新鲜的习惯清单需要避免。
这就是军备竞赛的缩影。检测公司挖掘模式,写作公司把这些模式训练掉,清单随之变化。有趣的问题不是下一代检测器能否抓住当前版本的模型。而是当双方都足够强,强到谁都无法确定时,信任会发生什么。
对读者而言,实际影响是慢慢失去一个本来就不太可靠的捷径。风格从来都是弱信号。抄袭者用自己的声音写了几个世纪,诚实的写作者也一直在借用短语。新的清单只是让这个弱信号变得可测量。
如果你发布内容,这意味着什么
对写作者来说,这项研究读起来不像威胁,更像一面镜子。如果 13,000 个短语都偏向机器文风,那么依赖这些短语的草稿就会读起来像机器文风,不管想法有多好。解决办法不是检测器,而是具体细节。
机器写作默认走向笼统,因为笼统总是安全的。人类写作充满了具体:街道的名字、没有凑整的数字、只有亲历者才会知道的细节。这些部分是再怎么擦洗短语也伪造不出来的,因为它们从一开始就不在训练数据里。
对编辑来说,实际教训与自动化相反。现在的破绽已经足够微妙,扫一眼是抓不住的。你必须去读节奏,读具体细节的缺失,而不是去找那个人人早已学会留意的标志性破折号。最可靠的编辑不是删掉明显的口头禅,而是加入模型不会凭空编出的那种具体细节——它既服务读者,又恰好能击败分类器。
没人能干净赢下的军备竞赛
这个故事有一个版本:检测问题被解决了。一个用足够多这类短语模式训练出来的分类器,能以高准确率标记 AI 文本,于是所有人都回去信任自己读到的东西。
这个版本有个问题。检测器一经发布,就变成了训练信号。下一代模型会被训练去避开检测器所依赖的任何东西,而清单又会变化。Graphite 的 13,000 个短语是一张快照,不是一劳永逸的裁定。
剩下的,是对“读起来像人”这一含义的缓慢重新定义。每一代模型都抬高了通用能力的下限,每一代也都让剩下的那些人类标记在对比中更显独特。破绽不会消失。它们会迁移到越来越小的姿态中,直到唯一可靠的信号只剩下那个一直可靠的信号:写作是否知道读者不知道的东西,并把它平实地讲出来。
短语清单无法衡量这一点。到目前为止,分类器也不能。这是写作中抗拒被编目的部分,也可能最终是最重要的部分。