随着大语言模型生成的文本无处不在,人们也越来越想找到识别它们的方法。尽管破折号和“delve”这类早期痕迹早已不再明显,但研究人员表示,AI 模型在写作时仍会反复依赖不少具有辨识度的习惯。
营销公司 Graphite 的一项新研究考察了前沿模型的写作习惯,梳理出各模型偏爱的词语和短语。研究发现,虽然像破折号使用这样的老特征已经被有意压制,模型仍然会频繁诉诸强调对比的句式,而且每个模型版本都展现出自己独特的怪癖。最令人意外的是,这类痕迹的范围非常广。Graphite 发现,有 1.3 万个短语在 AI 内容中的出现频率至少是人类内容的两倍,这也是该公司对“痕迹”的定义。
Graphite 首席 AI 官 Greg Druck 对 TechCrunch 表示:“事实证明,Claude 模型随着时间推移,实际上越来越接近人类的词汇分布。而 GPT 模型则越来越远离这种分布。”
要大规模研究 AI 生成写作,需要非常谨慎的研究设计。Graphite 先建立了一个由 1 万篇文章组成的语料库,这些文章都发表于 ChatGPT 发布之前,作为人类写作的对照组。随后,研究人员让不同的 AI 模型根据摘要重写这些文章,希望尽可能消除来源偏差。有了人类样本和各模型样本的对应数据后,他们就可以比较某些词语和短语在 AI 写作中的出现频率,以及句子结构层面的更广泛模式。
根据 Graphite 的结果,Claude Opus 5.5 最明显的痕迹是“dependable”这个词,其出现频率是人类样本中的 23 倍。虽然 Opus 5.5 现在会避免使用“it’s not X, it’s Y(不是 X,而是 Y)”这种句式,但它仍倾向于说某件事“is more than an X, it’s a Y(不只是一个 X,它还是一个 Y)”。
最突出的是,Opus 很喜欢告诉你某件事为什么重要。在其文本中,“this matters(这很重要)”的出现频率是人类写作的 116 倍,而“why X matters(为什么 X 很重要)”则高出 92 倍。
OpenAI 的 Astra 则有另一套明显特征。这个模型很喜欢把所讨论的事物描述为“another dimension(另一个维度)”,并且倾向于通过“may provide(可能提供)”或“can provide(可以提供)”这样的说法来弱化断言。它最明显的痕迹,是 Graphite 所说的“corrective framing(纠正式框架)”:即把一个主题定义为“not simply X(不只是 X)”,或者以“rather than relying on X(而不是依赖 X)”的方式提出替代方案。根据 Graphite 的研究,这类结构在 Astra 生成文本中的出现频率比在人类写作中高出 100 多倍。
值得注意的是,所有前沿实验室似乎都已经对“模型过度使用破折号”这一看法作出反应。在 Graphite 的样本中,Opus 5.5 使用破折号的频率比 Opus 5 低 99%。Astra 现在使用破折号的频率也比人类样本低 88%,而 Gemini 3.1 Pro 几乎已经在写作中彻底消除了破折号。
不过,尽管单个痕迹会变化,Graphite 表示,整体痕迹数量基本保持稳定。Druck 对 TechCrunch 表示:“并不是说这些痕迹在减少。他们确实设法去掉了最广为人知的那些痕迹,但其他痕迹又会冒出来。而且每个模型版本都有自己的痕迹。”
考虑到这些实验室一直强调追求人类化写作风格,这些痕迹如此顽固,多少有些令人意外。在发布 Opus 5.5 时,Anthropic 曾宣称该模型“比以往模型沟通得更自然”,并表示早期用户“觉得它的写作更清晰、更容易理解”。
OpenAI 在发布 GPT-6 版本的 Sol 和 Luna 时也提出了类似说法,称用户可以“期待看到更清晰、更少术语,以及更少奇怪的措辞转折”。
但 Druck 对这些实验室究竟能在多大程度上彻底消除这些标志性句式或短语持怀疑态度。
Druck 说:“我的一个总体假设是,这些实验室对某些问题的控制能力,可能没有外界想象得那么强。这些都是拥有数十亿参数的庞大模型。他们能运行的测试数量是有限的,总会有一些东西漏过去。”











