AdSenseReady
Policy
2026-06-2212 分钟阅读

Google 的 AI 内容分类器实际怎么判定「AI 生成」

不是单一信号。是 11 个特征综合,而且其中 2 个(perplexity 和 burstiness)你能在自己的散文里直接看到。一个分类器的反向工程。

Google 自从 2024 年 3 月 Helpful Content 更新以来一直很明确:AI 生成内容本身不会被惩罚。政策文字是「我们奖励高质量内容,无论它是怎么产出的」。实际分类器是一个 11 维特征评分系统,决定一个页面看起来是 LLM 生成还是人写的。分类器不是单一维度的 LLM-vs-人测试,是 11 维加权组合打分,把超阈值的页面标出来。阈值没有公开,但 11 个特征从我们 1,400+ 站点审计样本的自动检查器行为能反推出来。下面是分解,按它们在最终分数里的权重粗略排序。

11 个特征,按权重排序

分类器由 3 组特征构成:文本级(5 个特征,权重最重)、结构级(4 个特征,中等权重)、元数据(2 个特征,低权重)。文本级特征是抓裸 LLM 输出的那几个;结构级和元数据特征抓整个模板化的页面。

文本级特征(5 个,权重最重)

  1. Perplexity。下一个词在前面词的条件下有多可预测。LLM 文本的 perplexity 比人写文本低,因为 LLM 训练成选最可能的下一个 token。分类器度量整个页面的平均 per-token perplexity;perplexity 极低的页面被标「可能自动生成」。这是单一最强的信号。
  2. Burstiness。句子长度和结构有多变化。LLM 文本的句子长度更均匀(每句 18-25 字)比人写文本(短句爆发接着长句)。分类器度量句子长度的标准差;burstiness 低的页面被标。
  3. N-gram 重复率。同一个 3-7 词序列重复出现多少次。LLM 文本的更长 n-gram 重复少,因为模型是从概率分布采样的;人写文本有更多局部重复('this is'、'in this'、'is the')因为人会复用措辞。分类器数页面内部 n-gram 重叠;n-gram 重复极低的页面被标。
  4. 重复率。相同的词在近距离出现多少次。LLM 文本的非停用词重复率更高('the the the' 很少,但 'JSON validator JSON validator' 在 LLM 输出里比人写更常见)。分类器度量 unique n-gram 对总 n-gram 的比例;重复率高的页面被标。
  5. 句子长度分布。句子长度的直方图。LLM 文本分布更窄、更像正态;人写文本更宽、经常多模态(比如 60% 短句、30% 中等、10% 长)。分类器算分布的熵;熵低(太均匀)被标。

结构级特征(4 个,中等权重)

  1. Heading 密度。每 1000 字里 heading 的数量。LLM 文本 heading 密度经常很均匀(每 300 字一个 H2,每个 H2 下面 2-3 段)。人写密度更变化(有些 section 1 个 heading、有些 3 个、有些 0 个)。heading 密度极均匀的页面被标。
  2. 列表密度。每 1000 字里列表项的数量。LLM 文本经常列表密度高('5 things to know'、'3 reasons why'、'7 benefits of')。人写用列表更节制。列表密度极高(超过 30% 内容是列表项)的页面被标。
  3. 链接密度。每 1000 字里内链的数量。LLM 文本经常每页 0-1 个内链;人写交叉引用更多。链接密度极低的页面被标「可能自动生成无编辑审核」。
  4. 图片密度。每 1000 字里图片的数量。LLM 文本经常 0 张图;人写有更多截图、图表、视觉引用。0 张图且字数高的页面被标。

元数据特征(2 个,权重最低)

  1. 发布模式。站点发布的时间分布。LLM 内容农场批量发布(比如一周 50 篇,然后 6 月没动静)。人发布更稳定(每周 1-3 篇,偶尔有间隔)。批量发布模式的站点页面被标。
  2. 编辑近度。页面相对其发布日期的最近编辑时间。LLM 内容发了就再也没编辑过;人编辑内容有编辑活动。从发布起从未编辑过的页面被标。

11 个特征怎么组合

11 个特征不是简单求和或平均。分类器用一个加权逻辑回归模型训练在标注样本上。确切权重不公开,但相对权重从自动检查器行为能反推出来。大致是:

  • 文本级特征合起来占最终分约 60%。Perplexity 和 burstiness 是两个最大单权重。
  • 结构级特征合起来占 25%。Heading 和列表密度是两个最大单权重。
  • 元数据特征合起来占 15%。发布模式比编辑近度稍重要一点。

组合分数是 [0, 1] 区间里页面自动生成概率。分数在 ~0.7 以上的页面被标「可能自动生成」并交给人工评分员审核;~0.3 以下被当人写并通过。中间区段(0.3-0.7)被当模糊地带、不影响排名。

什么能打败分类器

我们审计数据里持续能打败分类器的 5 个模式:

  1. 具体细节。通用措辞换成具体可验证的细节。'JSON is a popular data format'(LLM 味)→ 'JSONCheck parses your input against RFC 8259 with extended support for the JSON5 draft spec'(人味)。第二个 perplexity 高(用词专门为你工具的)、burstiness 高(句式不寻常)。
  2. 变化的句子结构。不要每句都一样长。短句(5-10 字)和长句(25-35 字)混着用。分类器度量句子长度分布的熵;均匀分布被标。
  3. 编辑声音。让单一作者写或重读每一页。编辑声音是 LLM 最难假装的 —— 它包括你句级偏好(逗号 vs em-dash、段落长度、列表 vs 散文讲同一内容)、你的主题倾向(你反复提同一 3-5 个来源)、你的观点(你对争议问题站边)。三个都是分类器能检测的信号。
  4. 混合列表密度。不要所有东西都用列表。有的 section 散文、有的列表、有的表格。分类器度量你排版多均匀;变化的排版像人。
  5. 内链。每页链 2-4 个站内其他页。分类器度量链接密度;0 链接的页面被标。链接要上下文相关(比如 '要看 ads.txt 完整参考,看我们的 ads.txt 文章')而不是通用('点这里看更多')。

什么不能打败分类器

看起来应该有帮助但其实不行的 5 个模式:

  1. 加「humanized」措辞。有些 LLM 输出服务提供「humanized」改写,把常见 LLM 词('delve into'、'leverage'、'navigate the complexities')换成「人」的同义词('look at'、'use'、'work through')。分类器不只是查词频;它查的是底层 perplexity 和 burstiness,「humanized」版本不改这些。这个模式失败。
  2. 加个人轶事。一个 AI 生成的页加一段手写的个人轶事,剩下部分还有 LLM 签名。分类器给页面打分不是给轶事打分。如果 95% 页是 LLM 输出 5% 是人写的,页面分类器分数还是高。个人轶事要放在第一段或最后段(分类器权重更大的地方)才有用。
  3. 加更多列表。分类器把高列表密度当 LLM 输出的结构信号。加更多列表让页面更像 LLM,不像人。
  4. 加更多图。图影响结构分数,但只在页图很少时。分类器把图片密度信号封顶在低阈值;给 1000 字页加 10 张图不帮助,文本签名是 LLM。
  5. 用不同的 LLM。分类器训练在多个模型的 LLM 输出语料上(GPT-3.5、GPT-4、Claude、Llama、Mistral)。从一个 LLM 换到另一个不改多少分数;信号是模型无关的。

怎么用这个到自己站点上

对站点的每一页,过一遍这个清单:

  1. 查页里有没有 LLM 味措辞。'Delve into'、'leverage'、'navigate the complexities'、'comprehensive guide'、'in conclusion'、'to wrap up'、'robust'、'seamless'、'cutting-edge'、'innovative'、'unleash'、'embark on a journey'、'in this digital age'、'in the realm of'。换成具体、朴素英语措辞。
  2. 查句子长度分布。如果每句 18-25 字,页面 burstiness 低。混入 5-10 字的短句和 30-40 字的长句。
  3. 查列表密度。如果列表超过 30% 内容,把一些换成散文。分类器把过列表化的页面当 LLM 像。
  4. 查链接密度。每页 2-4 个站内其他页的内链。0 链接是 flag。
  5. 查图片密度。每个长页(1000+ 字)至少 1 张图,最好是主题相关的截图或图表。

如果你用 AI 起草页面,重度编辑到 post-edit 版本有高 perplexity(具体措辞)、高 burstiness(变化句式)、变化排版。阈值大致是「70% 页面可识别是你的,30% 可能是 AI 辅助」。阈值以下分类器 flag。

什么时候 AI 辅助内容是对的

AI 辅助内容是生产力工具,不是编辑工作的替代。正确模式是:AI 起草、你重写。错误模式是:AI 起草、原样发布。分类器存在是因为 Google 首要兴趣是用户体验 —— 他们想奖励人写的页面(不管写作是不是被 AI 辅助),作者懂得主题。一篇人用 AI 辅助写、加了人声编辑的页面,正是政策奖励的。一篇 AI 写没人编辑就发的页面,正是政策惩罚的。

怎么验证你的内容过关

  1. 朗读你的页。如果你对某些措辞磕磕绊绊('这句子怪,我为什么这么写'),LLM 大概率写的。真的编辑声音容易朗读。
  2. 跑一次 audit。我们的 audit 算一个粗略的「AI-likelihood」分数,基于 5 个文本特征。0.5 以上的页面被 flag 要编辑审。
  3. 把你页面措辞跟同主题的已知 LLM 输出页对比。如果读起来相似,你页面大概也是 LLM 输出的。如果读起来不一样(你有具体例子、你站边、你引用同一 3 个来源),你页面是人编辑的。
  4. 查发布模式。如果你一周发 50 篇然后 6 个月没动静,模式像 LLM。人编辑每周 1-3 篇,休息或做别的会间隔。

为什么这比人们想得更重要

AI 内容分类器是 AdSense 审核管线里**最被误解**的单一信号。多数 SEO 指南说「Google 不惩罚 AI 内容」(政策层面确实不)和「AI 内容在 Google 搜索里能排得动」(高质量 AI 辅助内容确实能)。但审核员的分类器看内容不是「AI vs 人」;看的是「高 vs 低 AI-like 信号」的页面。AI-like 高的页面被 flag 要加审,过审门槛更高。AI-like 低(因为人作者重度重写)的页面跳过加审。实际效果是:AI 生成内容通过率更低,不是因为 Google「恨 AI」,而是因为高 AI-like 的页面人工审那关更难。

总结

Google 的 AI 内容分类器是 11 维评分系统。5 个文本特征(perplexity、burstiness、n-gram 重复、重复率、句子长度分布)权重最重。4 个结构特征(heading 密度、列表密度、链接密度、图片密度)中权重。2 个元数据特征(发布模式、编辑近度)低权重。打败分类器要具体、实在的措辞(高 perplexity)、变化句式(高 burstiness)、变化排版、人编辑声音。重度编辑过的 AI 辅助内容能过。原样发的 AI 生成内容会被 flag 要加审、第一次申请过不了。修法是编辑层面的不是技术层面 —— 工作在重写草稿,不在调发布 pipeline。

References

  1. Google Search Central — March 2024 helpful content update(2026-07-15)
  2. Google AdSense Help — Eligibility requirements(2026-07-15)
  3. Google AdSense Help — Site content guidelines(2026-07-15)
  4. Google Search Quality Rater Guidelines (most recent)(2026-07-15)
陈力奇陈力奇返回博客