大多数“如何识别 AI 写作”的指南把所有模型混为一谈。事实并非如此。GPT、Gemini 和 Claude 有着截然不同的习惯,如果你读过很多各自的输出,就会像区分两位同事的邮件语气一样把它们区分开来。
本文专门探讨 Claude — 它的文本究竟长什么样、哪些特征经得起检验,以及哪些流传甚广的说法其实并不靠谱。
精简要点
Claude 的标志性特征不是某个词,而是一种姿态:频繁的对冲表述、无论如何都各打五十大板的平衡中立,以及对所有内容套用结构化框架。寻找那些谨慎拒绝下绝对结论、且即便问题未作要求也把内容整理得井井有条的文章。
Claude 的写作实际听起来如何
这些是在大量样本中经得起检验的模式。单凭任何一条都算不上铁证 — 人类也会这么写,尤其是写作严谨的人 — 但叠加在一起就非常鲜明。
频繁使用对冲词(Hedging)
“值得注意的是……”、“话虽如此……”、“我应该指出……”、“虽然 X,但 Y 也是事实”。 Claude 被微调训练为避免过度断言,这表现为整篇文章中持续出现的限定词。在自己领域写作的人类专家通常更愿意直接陈述事实。每三句话就限定一次的文章,要么出自极其谨慎的写作者,要么出自大模型。
无论你是否询问,它都会给出双向立场
向它征求一个观点,你往往会得到一份平衡的综述。它有着标志性的结构:支持的理由、反对的理由,最后得出一个折中的合理总结。真实的人类立场写作通常早早就选定立场,并用全文篇幅去捍卫该立场。
它将所有内容结构化
小标题、编号步骤、项目符号前的加粗标签、结尾的总结。Claude 默认追求结构,即便是一个很自然能用一段话回答的问题也不例外。如果一个 400 字的回答附带了三个小标题和一个结尾总结,这就是一个信号。
加粗标签的项目符号模式
具体而言是这种形状:“清晰度: 写作应当条理清晰、易于理解。” 一个加粗的一两个词标签、一个冒号,然后是一段解释。这是一种非常优秀的格式,正因如此它在 Claude 的输出中无处不在,而在人类草稿中相对罕见(人类的项目符号通常更随意、不那么平行对称)。
它会在回答前先重述问题
在正式回答前,用一段简短的开场白重新表述提问内容。人类通常会直接开始回答,因为他们已经知道自己问了什么。
对 Claude 无效的误区特征
某些标准建议在这方面会产生严重的误导。
破折号
Claude 确实使用破折号,并且有段时间这被当成马脚。它不再可靠有两个原因:一是模型在破折号变成网络梗后被微调削弱了该特征;二是大量优秀的人类写作者也在频繁使用破折号。仅凭标点符号打分会误伤大量无辜作者。
“Delve” 等词汇清单
词汇层面的破绽随着每次模型更新而失效。2024 年感觉很独特的词汇在当前的输出中早已消失殆尽。如果你的检测方法是违禁词列表,其保质期将以月计算。
礼貌客气的语气
Claude 在对话框里的温和是助手格式的产物,而不是其生成的文章本身。要求它写一份技术文档,你就会得到一份技术文档。凭最终文章是否听起来友好来判断,得不出任何有效结论。
为什么 Claude 通常比 GPT 更难抓
在实践中,Claude 撰写的文章触发检测器报错的频率往往略低于其他模型,原因很朴素:它的句子长度更有变化。大多数统计检测器依赖困惑度(Perplexity)和突发性(Burstiness)— 大致衡量每个词的可预测性以及句长的变化程度。将 30 个字的句子与 6 个字的句子交替使用的输出,在这些指标上比匀速维持 18 个字的输出看起来更像人类。
这并不意味着它不可检测。这代表信号更多蕴含在结构与对冲语气中,而不是原始统计数据中,这也是为什么仔细阅读文章依然至关重要的原因。
用检测替代凭空猜测
如果你希望用客观测量替代眯眼观察,我们的Claude AI 检测器可以对照 Claude 的特定特征对文本进行打分,并展示推高分数的具体句子。推理过程才是最有用的部分 — 孤立的百分比无法提供可供操作或辩驳的信息。
在指控任何人之前
这比本文中的任何破绽都重要。AI 检测是概率性的,最容易被误判的人往往是那些写作工整、严谨、结构清晰的人:被教授过标准学术格式的非母语写作者、严格遵循论文模板的学生,以及对文章进行深度润色的人。
高检测分数是展开沟通的理由,而不是不诚实的证据。询问对方的写作过程,询问他们某个具体段落的本意。这比一个冰冷的分数能告诉你多得多的信息。
客观总结
你可以学会识别 Claude 的风格声音,上述特征也客观存在。但它们描述的是一种风格,而风格在两个方向上都可以被模仿 — 人类可以写得像 Claude,Claude 也可以通过提示词要求不写成这种风格。请将模式视为需要权衡的参考证据,而不是直接下达的判决。
