MadeInRed

评分方法论

ChatGPT 搜索的检索层 = Bing 索引 + OAI-SearchBot 补充抓取。被引用要过三道门:能不能主动推进索引、爬虫能不能进门、进了索引能不能被摘走。抓取许可是真实命门,权重最高。

分数是怎么算出来的?

四十多项确定性检查分属三层,每层有固定分值池:抓取许可 45、推送就绪 25、引用形态 30,合计 100;新兴信号最多加 5 分。层内按每项权重加权平均后映射到分值池,部分通过按比例得分,不适用的检查剔除后重新归一化,所以单语站不会因为没有 hreflang 而失分。总分取整后再套硬门槛封顶。

为什么要有硬门槛?

因为有几件事失败时,其它项做得再好也换不来引用:页面本身打不开、被 noindex、robots.txt 封了 OAI-SearchBot、Content-Signal 禁止 AI 输入,或者 WAF 把爬虫拦在门外。这些情况下把总分封顶并单独标红,是为了让报告的第一眼落在真正致命的那一条上,而不是被一堆小项稀释。

分值池

分值池说明
抓取许可45ChatGPT 搜索的检索层 = Bing 索引 + OAI-SearchBot 补充抓取。robots.txt 必须放行 OAI-SearchBot 与 ChatGPT-User,且 WAF(尤其 Cloudflare 的 Bot Fight / AI 爬虫拦截)不能把它们拦在门外。这一层是被引用的真实命门,权重最高。
推送就绪25主动把页面"pin"进 Bing 索引所需的基础设施:sitemap、Bing Webmaster Tools 验证、IndexNow、canonical、订阅源。省掉的是被发现的等待,省不掉的是建立权重的时间。
引用形态30进了索引不等于被引用。ChatGPT 挑的是能直接摘走的内容:服务端渲染的正文、问句式 H2、紧跟其后 40–80 词的直接结论、日期与作者、结构化数据、可抽取的列表与表格。
新兴信号+5llms.txt、Markdown 内容协商、API 目录、FAQ 结构化数据等面向 agent 的新约定。最多 +5 分,缺失不扣分。

硬门槛(封顶)

  • 页面对普通访客不返回 200 → 总分封顶 29
  • noindex、robots.txt 封 OAI-SearchBot、Content-Signal 禁止检索或 AI 输入 → 封顶 39
  • WAF 实测拦截 OAI-SearchBot → 封顶 49
  • robots.txt 封 Bingbot → 封顶 59(Bingbot 的 WAF 实测只计分不封顶:大站普遍对 Bingbot 做 IP 反查,伪造 UA 被拒属正常)

抓取许可 · 45 分 · 不开门,推了也白推

检查权重为什么重要
robots.txt 放行 OAI-SearchBot
robots-oai-searchbot
10OAI-SearchBot 建 ChatGPT 搜索索引,封了它等于永久放弃被引用。
robots.txt 放行 ChatGPT-User
robots-chatgpt-user
5用户提问时的实时抓取,决定 ChatGPT 能否当场读到你的页面。
robots.txt 放行 Bingbot
robots-bingbot
5ChatGPT 搜索的检索层建在 Bing 索引上。
robots.txt 放行 Googlebot
robots-googlebot
2喂 AI Overviews 与 Gemini。
放行其它 AI 答案引擎
robots-ai-answer-engines
3Perplexity、Claude、DuckDuckGo AI、Apple、Amazon 的检索爬虫,同一套逻辑。
Content-Signal 未禁止 AI 检索
content-signal
3Cloudflare 托管 robots.txt 会注入 Content-Signal,search=no 或 ai-input=no 会被合规爬虫尊重。
实测:OAI-SearchBot 身份可抓取
waf-oai-searchbot
9robots.txt 写得再对,WAF 在前面拦一下就全白搭。以 OAI-SearchBot UA 实抓验证。
实测:ChatGPT-User 身份可抓取
waf-chatgpt-user
5实时抓取的身份,同样会被 Bot Fight Mode / AI 爬虫拦截规则误伤。
实测:Bingbot 身份可抓取
waf-bingbot
4进不了 Bing 索引,ChatGPT 搜索就找不到你。
页面允许索引
indexable
5noindex(meta 或 X-Robots-Tag)会让页面从任何索引中消失。
允许摘录片段
snippet-allowed
3nosnippet / max-snippet:0 直接禁止引擎摘录你的文字。
HTTP 基础健康
http-health
3HTTPS、200、短跳转链、合理响应时间是爬虫预算的前提。
不存在的路径返回真实 404
soft-404
2软 404 会让爬虫以为所有路径都存在,浪费抓取预算并污染索引。
GPTBot(训练爬虫)策略
robots-gptbot
仅展示放不放行不影响被引用,可自行决定。仅展示。
CDN / WAF 识别
waf-detected
仅展示走 Cloudflare 的站必须逐站核查 Bot Fight Mode 与 AI Crawl Control。仅展示。

推送就绪 · 25 分 · 等价于 GSC 的那个按钮

检查权重为什么重要
sitemap.xml 存在且被 robots.txt 声明
sitemap-present
6Bing Webmaster Tools 一键导入与 URL 提交都以 sitemap 为骨架。
sitemap 带 lastmod 且近期更新
sitemap-freshness
4lastmod 是 Bing 判断"要不要重抓"的主要信号。
sitemap 里的 URL 真实存活
sitemap-urls-alive
5sitemap 是你交给引擎的清单;里面的死链会让 OAI-SearchBot 把抓取预算花在 404 上,引用机会直接丢掉。抽检最多 8 条。
Bing Webmaster Tools 验证痕迹
bing-verification
5注册 Bing 站长平台才能手动请求收录——这就是那个"pin"按钮。
Google Search Console 验证痕迹
google-verification
1GSC 照旧走,喂 AI Overviews 与 Gemini。可能通过 DNS 验证,站外不可见。
canonical 自指向
canonical
3避免推送的 URL 与索引的 URL 不一致,权重被分散。
多语言 hreflang
hreflang
2出海站的多语言版本要让 Bing 分清市场;单语站不适用。
RSS / Atom 订阅源可发现
feed
1Bing 支持订阅源提交,新文章发布可被快速发现。
http 自动跳转 https
https-redirect
2推送的 URL 与最终 URL 必须一致,避免重复实体。
title 与 meta description 完备
title-description
2Bing 索引条目的骨架,也是 ChatGPT 引用卡片的标题来源。
IndexNow 即时推送
indexnow
仅展示发布瞬间 ping 一下,Bing 立即知道;key 文件名不可预测,站外无法验证,需自查。

引用形态 · 30 分 · 推不动,只能塑形

检查权重为什么重要
服务端渲染的正文
ssr-content
6OAI-SearchBot 与 ChatGPT-User 不执行 JavaScript,看到的就是原始 HTML。
标题层级清晰
heading-structure
3唯一 H1 + 多个 H2,层级不跳跃,是可摘录内容的骨架。
H2 使用问句 / 对比句
question-headings
4ChatGPT 按用户问题匹配段落,问句式标题命中率最高。
标题后紧跟 40–80 词直接结论
direct-answers
4能被整段摘走的答案块,是被引用的最小单元。
抽样页面的引用形态(产品 / 文章 / 分类)
sampled-pages-shape
5AI 引用发生在页面级,被引的从来不是首页。从 sitemap 抽产品页、文章页、分类页各一个,按同一套引用形态标准打分。
Product / Offer 结构化数据完整
product-schema
3ChatGPT 购物卡片直接读 Product 的 price、priceCurrency、availability、GTIN;缺了就进不了卡片。无产品页时不适用。
关于 / 联系 / 政策页可抓取
trust-pages
2引擎判断"这是一家真实商家"的最低门槛,也是 Agentic Commerce 要求的退换货 / 隐私政策 URL 的来源。
发布 / 更新日期可机读
dates
3带日期的页面更容易被选为"最新"来源;一年内更新加分。
作者 / 发布者可机读
author
2归属明确的内容更可信,E-E-A-T 的基础。
JSON-LD 结构化数据
structured-data
3Article / Product / Organization 等 schema 帮引擎理解页面是什么。
品牌实体(Organization + sameAs)
org-entity
2让引擎把站点、社媒、Wikidata 等身份连成一个实体,"有其他站佐证"的起点。
可抽取的列表 / 表格
extractable-structures
2对比表、步骤列表最容易被整块摘录。
引用外部来源
outbound-citations
2有据可查的内容更像"可信资料",而不是营销页。
<html lang> 声明
lang-declared
1让引擎把页面归入正确的语言市场。
Open Graph 完整
open-graph
1ChatGPT 引用卡片与分享预览的标题、描述、图片来源。
<main> / <article> 语义容器
main-landmark
1帮抽取器区分正文与导航噪音。
图片 alt 文本
image-alt
1多模态检索与无障碍的共同基础。

新兴信号 · +5 分 · 有则加分,无不扣分

检查权重为什么重要
/llms.txt
llms-txt
2面向 LLM 的站点导览,告诉 agent 你是谁、何时该用你。
/llms-full.txt
llms-full-txt
1全文版导览,供 agent 一次读完。
Accept: text/markdown 内容协商
markdown-negotiation
1.5同一 URL 给 agent 返回 Markdown,摘录零噪音。
/.well-known/api-catalog
api-catalog
0.5RFC 9727 机器可读的 API 目录。
AggregateRating / Review 结构化数据
review-schema
1评分与评论是购物类回答里最常被摘走的字段。
FAQPage / HowTo 结构化数据
faq-schema
1问答对是最容易被整条摘走的形态。
ETag / Last-Modified
conditional-headers
0.5让爬虫用条件请求高效重抓。

实测抓取是怎么做的?

对同一 URL 分别用普通浏览器、OAI-SearchBot、ChatGPT-User、Bingbot 的 User-Agent 抓取,比较状态码、cf-mitigated 头、挑战页特征与正文长度。出口 IP 不是各爬虫的官方 IP 段,所以 IP 白名单式放行在此看不到;但 UA 级封禁(Cloudflare 的 AI 爬虫一键拦截、自定义 WAF 规则)会原形毕露。最终确认以服务器日志里真实爬虫回 200 为准。

"ChatGPT 视角"和"模拟提问"是什么?

报告里的 ChatGPT 视角把爬虫从原始 HTML 抽出的正文、每个 H2/H3 后的第一段直接摆出来,并标出哪些块符合"40–80 词直接结论"可整段引用、哪些需要改写、哪些标题后面根本没有段落。模拟提问则让模型扮演 ChatGPT 搜索:这页能回答用户的哪三个问题、会逐字摘走哪一段、摘不动的原因是什么。它是佐证,不计入分数——一次模拟代表不了所有提问。

这个分数不能说明什么?

  • IndexNow 接入、Bing/GSC 的 DNS 验证、站外引用("其他站佐证")无法从站外验证,相关项标为仅展示或减半。
  • 报告描述某一时刻的公开证据,不是认证,也不是安全或无障碍审计。
  • 时效预期:已在 Bing 相关词前十的页面,发布后几天内就可能出现在引用里;Bing 零基础的站要 4–12 周。pin 省掉的是被发现的等待,省不掉的是建立权重的时间。

机器可读:/api/v1/methodology · Markdown · MCP 工具 is_cited_get_methodology