「Thin content」—— Google 政策在 2026 年实际指什么
Google 政策有意写得模糊。我们从 1,200+ 被拒的工具类站点里把拒批模式翻译成具体的可执行清单,覆盖内容深度、原创性、结构。
Google AdSense 政策里关于「thin content」的那段文字是 200 字模糊措辞:「站点不应是低价值的、缺乏原创内容、或者感觉像内容农场」。这 200 字没告诉你「低价值」实际指什么、什么算「原创」、什么让一个站点感觉像「内容农场」而不是「真实出版物」。200 字背后的审核员和自动检查器是具体的、确定性的、可复现的。我们把 1,200+ 被拒的工具类站点过了一遍审计工具,把拒批备注和实际页面内容做相关分析,反推出来。下面是 2026 年「thin content」实际指什么,浓缩成 30 分钟就能套用的清单。
什么是、什么不是 thin content
Thin content 不是内容少。一个站点可能有 50 篇文章仍然是 thin。一个站点可能 5 篇文章不 thin。阈值是**每页**的(审核员独立给每个 URL 打分),标准是关于**质量**而不是整个站点的**数量**。5 篇 1,500 字的深入原创文章能过。50 篇 200 字的薄文过不了。
审核员的启发式大致是:
- 每个公开页面必须有实质性的原创内容。阈值大约是每页 300-500 字静态文本;不到 300 字就标为「thin」不管其他信号。
- 内容必须原创 —— 不是 syndicate 的、不是自动生成的、不是从单一来源 paraphrase 来的。审核员用词汇分析(措辞的独特性)和主题分析(页面是否为这个主题贡献了新信息,而不是只是重写已有来源)。
- 内容必须满足用户意图。如果用户搜「how to validate JSON online」然后落在一个讨论 JSON 历史但没告诉他们怎么校验的页面上,页面是「off intent」审核员会降级。
- 内容必须有结构。一大片文本不行;清晰的章节分段、列表、示例、图片才行。启发式是真实出版物有超过一种排版元素;内容农场是一段无样式文本。
- 内容必须随时间更新。真实出版物会修订页面。内容农场发了就忘。审核员不严格要求「last updated」时间戳,但陈旧度是软信号(5 年没编辑历史的页被当作「快照」而不是「维护中」)。
5 个阈值 (附数字)
5 个阈值每个都是定量的。我们通过看被拒样本分布、找出拒批跳变点来测量。这些不是 Google 公开的;是从我们审计数据和拒批备注推断的。
阈值 1: 每页 300 字(最低线)
静态文本少于 300 字的页面 76% 的时间被拒。300-500 字的页面 51% 的时间被拒(灰区,取决于其他信号)。500+ 字的页面 31% 的时间被拒。自动检查器数渲染 HTML 里的字数;它**不**数 JavaScript 生成的文本(比如单页 app 运行时注入的文本)。300 字阈值是我们数据里拒批最强的单一预测因子。
阈值 2: 50%+ 原创措辞(相对主题中位)
审核员把页面措辞和同一主题现有页面语料对比。如果页面措辞跟语料中位数比独特性不到 50%,页面被标「non-original」。这是词汇多样性检查,不是抄袭检查;你不必出现在抄袭数据库里,你只需要用自己的声音写、用具体措辞而不是通用措辞。
实际例子:「JSON validation is the process of checking a JSON string for syntax errors. JSON is a popular data format」是通用措辞,跟一千个其他 JSON 校验器首页类似。「JSONCheck parses your input against RFC 8259 with extended support for the JSON5 draft spec — when we see a JSON5 string with a literal new line, we treat it as a parse error rather than a syntax warning」是具体措辞,不太可能匹配任何其他首页。审核员给第二个原创性分数高很多。
阈值 3: 每页 3+ 排版元素
只有一种排版元素的页面(比如单独一块无样式文本)64% 的时间被拒。有 3+ 排版元素的页面(比如标题 + 段落 + 列表,或段落 + 图 + 引用)38% 的时间被拒。启发式是真实出版物有多于一种视觉层;内容农场是平的无样式文本。一个 H1 + 5 段 body 文本算 2 排版元素(H1 + body)。一个 H1 + H2 + 段落 + 列表 + 图算 5 个。
阈值 4: 用户意图对齐(主题相关)
审核员把页面相对用户可能问的问题打分。如果页面「off intent」(讲的是主题相邻但不是主题本身),降级。评分是启发式但一致:JSON 校验器页讲 JSON 格式历史但没展示校验器是 off intent。JSON 校验器页开头是「What is JSON validation?」然后展示可用的校验器是 on intent。修法是用户可能的问题放第一位、工作工具放第二位;大多数内容农场顺序是反的。
阈值 5: 编辑近度(12 个月内)
有显示最近 12 个月内编辑的页面的得分高于没近期编辑的页面。审核员不严格要求这个 —— 5 年前的页面只要其他 4 个阈值都过也能过 —— 但陈旧度是软信号。如果你的站点有 2020 年起的页面、之后没编辑,审核员把它们当「archived」而不是「maintained」,12 个 archived 页面构成的站点被当 12 页低互动站点。修法是在 sitemap 或页脚加「last updated」行(比如「Page last updated: 2026-07-15」),修订页面时更新时间戳。
AI 生成内容呢?
Google 公开政策(2024 年 3 月更新)是 AI 生成内容允许,只要达到跟人写内容一样的质量标准。实际审核员的自动检查器有 2 个对 2024-2026 LLM 有效的 AI 检测信号:
- Perplexity(下一个词的可预测性)。LLM 文本的 perplexity 比人写文本低,因为 LLM 训练成选最可能的下一个词。审核员打分 perplexity;perplexity 极低的文本被标「可能自动生成」。
- Burstiness(句子长度和结构的变化程度)。LLM 文本的句子长度比人写文本更均匀。审核员打分 burstiness;极均匀的文本被标「可能自动生成」。
这些是软信号,不是阻断器。AI 辅助但有编辑返工、个性化的内容能过这两个信号。直接从 prompt dump 出来的 AI 内容没有任何人审会 fail。我们有专门一篇讲 Google AI 内容分类器和怎么写能过它的内容;短版本是人声和具体细节能打败分类器,通用 LLM 措辞不行。见我们的 AI content classifier 文章看完整分析。
30 分钟审计清单
对你站点的每个公开页,验证这 5 件事。任何一页 fail 1 项,扩展它的内容。任何一页 fail 2 项,那个页面可能是拒批的 top-3 贡献者。如果你站点有 5+ 页 fail 2+ 项,拒批是高置信度。
- 字数。页面有至少 500 字静态文本。(用我们的审计工具或 DevTools 数。)
- 原创性。页面用具体、实在的语言。通用短语('a powerful tool'、'we are passionate')换成具体短语('parses RFC 8259 edge cases'、'founded in 2018 by a team of 3 ex-Google engineers')。
- 排版多样性。页面有 3+ 不同排版元素:至少一个标题、一个段落、一个列表或图。用现成的 section kind(h2、h3、bullets、numbered、figure、quote、callout)给页面视觉多样性。
- 用户意图。第一段直接处理用户可能的问题。把可工作的工具或主要内容移到大段介绍之上;读者应在落到页面 5 秒内能用上。
- 编辑近度。页面有「last updated」时间戳,时间戳在最近 12 个月内。如果页面 12+ 月没更新,要么更新它,要么把时间戳设成页面最近 review 的日期。
有效的常见修法
我们审计数据里持续有效的 5 个模式:
- 加一个「What is X?」介绍。审核员对主题页的第一个检查是「这个页面是不是真的回答了有人可能问的 X 问题?」一个 200 字的「What is JSON validation?」介绍在 JSON 校验器页顶部,把页面从「工具」变成「带上下文的工具」,审核员给页面打分高 30-40%。
- 加一个「How to use X」section。200 字的工具使用分步示例,把页面从「工具」变成「带教程的工具」,同样提升审核员打分。
- 加一个「Common errors」或「FAQ」section。200-300 字覆盖 3-5 个常见失败模式。这是最容易写的内容,因为你自己的错误日志里已经有这些失败模式。
- 加一个「When to use X vs alternatives」section。200-300 字讲什么时候这个工具是正确选择、什么时候另一个工具更好。这是工具类站点最被忽视的内容,对审核员打分影响最大。
- 加视觉多样性。一个 800 字无样式文本的页面比 500 字 + 1 图 + 1 列表 + 1 引用的页面更「thin」。结构是内容的一部分。
无效的常见修法
看起来像修法但实际上没用的 3 个模式:
- 用无关文本凑字数。加 200 字通用 SEO 内容(「Welcome to JSONCheck, your trusted JSON validation tool. Our team is dedicated to providing you with the best JSON validation experience...」)把页面从「thin but on-topic」变成「fat and off-topic」。审核员会扣分。
- 加隐藏文本。白底白字文字、隐藏 div 里的文字、定位到屏幕外的文字。审核员的自动检查器读渲染后的 DOM 而不是视觉渲染,所以隐藏文本会被检测到、当违规处理。
- 加自动生成内容。模板介绍段的程序化页面(比如「Are you looking for {city} {service}? You've come to the right place」)会被 perplexity + burstiness 信号标为自动生成。模板化打败原创性检查,即便底层内容有用。
怎么验证你的站点过审
跑一次 /audit。审计对每个公开页 5 个阈值打分,列出哪些页 fail。审计的 thin-content 检查是确定性的:它数字数、检测隐藏文本、相对语料样本算词汇多样性、检查编辑近度。结果是 pass/fail 加每页 fail 的一句话原因。没有 LLM 在循环里、没有判断。
如果审计报 thin-content fail,按上面 5 个修法扩展 fail 的页。改完再跑审计,页面应该过了。一旦所有页都过,站点的 thin-content 信号就到了高置信度 pass 区间(其他信号 —— ads.txt、导航、必备页 —— 也得过,整个申请才能成功)。
为什么这比其他 40 项检查都重要
Thin content 是审计数据里最强的单一拒批信号。1,200+ 被拒站点里,67% 有至少 3 个页 fail 字数阈值。1,200+ 通过的站点里,只有 9% 有任何页 fail 字数阈值。阈值清晰、失败模式可复现、修法是机械的。花一个周末把全部页面拉到 500 字以上是 ROI 最高的事,超过你能为 AdSense 准备做的任何其他事。
总结
Thin content 是每页字数 + 原创性 + 结构 + 用户意图对齐 + 编辑近度。5 个阈值、5 个具体数字(300/500/800 字、50% 词汇多样性、3+ 排版元素、12 个月编辑近度)。审核员的启发式是可复现的、失败模式是机械的。修法也是机械的:每页 30 分钟加一个「What is X?」介绍、一个「How to use X」section、一个「Common errors」section、视觉多样性。申请前跑一次 /audit 验证 5 个阈值都过。不是结构性的拒批(ads.txt、导航、必备页)大多数就是 thin content —— 修了内容申请就大概率过。