评分方法论
ChatGPT 搜索的检索层 = Bing 索引 + OAI-SearchBot 补充抓取。被引用要过三道门:能不能主动推进索引、爬虫能不能进门、进了索引能不能被摘走。抓取许可是真实命门,权重最高。
分数是怎么算出来的?
四十多项确定性检查分属三层,每层有固定分值池:抓取许可 45、推送就绪 25、引用形态 30,合计 100;新兴信号最多加 5 分。层内按每项权重加权平均后映射到分值池,部分通过按比例得分,不适用的检查剔除后重新归一化,所以单语站不会因为没有 hreflang 而失分。总分取整后再套硬门槛封顶。
为什么要有硬门槛?
因为有几件事失败时,其它项做得再好也换不来引用:页面本身打不开、被 noindex、robots.txt 封了 OAI-SearchBot、Content-Signal 禁止 AI 输入,或者 WAF 把爬虫拦在门外。这些情况下把总分封顶并单独标红,是为了让报告的第一眼落在真正致命的那一条上,而不是被一堆小项稀释。
分值池
| 层 | 分值池 | 说明 |
|---|---|---|
| 抓取许可 | 45 | ChatGPT 搜索的检索层 = Bing 索引 + OAI-SearchBot 补充抓取。robots.txt 必须放行 OAI-SearchBot 与 ChatGPT-User,且 WAF(尤其 Cloudflare 的 Bot Fight / AI 爬虫拦截)不能把它们拦在门外。这一层是被引用的真实命门,权重最高。 |
| 推送就绪 | 25 | 主动把页面"pin"进 Bing 索引所需的基础设施:sitemap、Bing Webmaster Tools 验证、IndexNow、canonical、订阅源。省掉的是被发现的等待,省不掉的是建立权重的时间。 |
| 引用形态 | 30 | 进了索引不等于被引用。ChatGPT 挑的是能直接摘走的内容:服务端渲染的正文、问句式 H2、紧跟其后 40–80 词的直接结论、日期与作者、结构化数据、可抽取的列表与表格。 |
| 新兴信号 | +5 | llms.txt、Markdown 内容协商、API 目录、FAQ 结构化数据等面向 agent 的新约定。最多 +5 分,缺失不扣分。 |
硬门槛(封顶)
- 页面对普通访客不返回 200 → 总分封顶 29
- noindex、robots.txt 封 OAI-SearchBot、Content-Signal 禁止检索或 AI 输入 → 封顶 39
- WAF 实测拦截 OAI-SearchBot → 封顶 49
- robots.txt 封 Bingbot → 封顶 59(Bingbot 的 WAF 实测只计分不封顶:大站普遍对 Bingbot 做 IP 反查,伪造 UA 被拒属正常)
抓取许可 · 45 分 · 不开门,推了也白推
| 检查 | 权重 | 为什么重要 |
|---|---|---|
| robots.txt 放行 OAI-SearchBot robots-oai-searchbot | 10 | OAI-SearchBot 建 ChatGPT 搜索索引,封了它等于永久放弃被引用。 |
| robots.txt 放行 ChatGPT-User robots-chatgpt-user | 5 | 用户提问时的实时抓取,决定 ChatGPT 能否当场读到你的页面。 |
| robots.txt 放行 Bingbot robots-bingbot | 5 | ChatGPT 搜索的检索层建在 Bing 索引上。 |
| robots.txt 放行 Googlebot robots-googlebot | 2 | 喂 AI Overviews 与 Gemini。 |
| 放行其它 AI 答案引擎 robots-ai-answer-engines | 3 | Perplexity、Claude、DuckDuckGo AI、Apple、Amazon 的检索爬虫,同一套逻辑。 |
| Content-Signal 未禁止 AI 检索 content-signal | 3 | Cloudflare 托管 robots.txt 会注入 Content-Signal,search=no 或 ai-input=no 会被合规爬虫尊重。 |
| 实测:OAI-SearchBot 身份可抓取 waf-oai-searchbot | 9 | robots.txt 写得再对,WAF 在前面拦一下就全白搭。以 OAI-SearchBot UA 实抓验证。 |
| 实测:ChatGPT-User 身份可抓取 waf-chatgpt-user | 5 | 实时抓取的身份,同样会被 Bot Fight Mode / AI 爬虫拦截规则误伤。 |
| 实测:Bingbot 身份可抓取 waf-bingbot | 4 | 进不了 Bing 索引,ChatGPT 搜索就找不到你。 |
| 页面允许索引 indexable | 5 | noindex(meta 或 X-Robots-Tag)会让页面从任何索引中消失。 |
| 允许摘录片段 snippet-allowed | 3 | nosnippet / max-snippet:0 直接禁止引擎摘录你的文字。 |
| HTTP 基础健康 http-health | 3 | HTTPS、200、短跳转链、合理响应时间是爬虫预算的前提。 |
| 不存在的路径返回真实 404 soft-404 | 2 | 软 404 会让爬虫以为所有路径都存在,浪费抓取预算并污染索引。 |
| GPTBot(训练爬虫)策略 robots-gptbot | 仅展示 | 放不放行不影响被引用,可自行决定。仅展示。 |
| CDN / WAF 识别 waf-detected | 仅展示 | 走 Cloudflare 的站必须逐站核查 Bot Fight Mode 与 AI Crawl Control。仅展示。 |
推送就绪 · 25 分 · 等价于 GSC 的那个按钮
| 检查 | 权重 | 为什么重要 |
|---|---|---|
| sitemap.xml 存在且被 robots.txt 声明 sitemap-present | 6 | Bing Webmaster Tools 一键导入与 URL 提交都以 sitemap 为骨架。 |
| sitemap 带 lastmod 且近期更新 sitemap-freshness | 4 | lastmod 是 Bing 判断"要不要重抓"的主要信号。 |
| sitemap 里的 URL 真实存活 sitemap-urls-alive | 5 | sitemap 是你交给引擎的清单;里面的死链会让 OAI-SearchBot 把抓取预算花在 404 上,引用机会直接丢掉。抽检最多 8 条。 |
| Bing Webmaster Tools 验证痕迹 bing-verification | 5 | 注册 Bing 站长平台才能手动请求收录——这就是那个"pin"按钮。 |
| Google Search Console 验证痕迹 google-verification | 1 | GSC 照旧走,喂 AI Overviews 与 Gemini。可能通过 DNS 验证,站外不可见。 |
| canonical 自指向 canonical | 3 | 避免推送的 URL 与索引的 URL 不一致,权重被分散。 |
| 多语言 hreflang hreflang | 2 | 出海站的多语言版本要让 Bing 分清市场;单语站不适用。 |
| RSS / Atom 订阅源可发现 feed | 1 | Bing 支持订阅源提交,新文章发布可被快速发现。 |
| http 自动跳转 https https-redirect | 2 | 推送的 URL 与最终 URL 必须一致,避免重复实体。 |
| title 与 meta description 完备 title-description | 2 | Bing 索引条目的骨架,也是 ChatGPT 引用卡片的标题来源。 |
| IndexNow 即时推送 indexnow | 仅展示 | 发布瞬间 ping 一下,Bing 立即知道;key 文件名不可预测,站外无法验证,需自查。 |
引用形态 · 30 分 · 推不动,只能塑形
| 检查 | 权重 | 为什么重要 |
|---|---|---|
| 服务端渲染的正文 ssr-content | 6 | OAI-SearchBot 与 ChatGPT-User 不执行 JavaScript,看到的就是原始 HTML。 |
| 标题层级清晰 heading-structure | 3 | 唯一 H1 + 多个 H2,层级不跳跃,是可摘录内容的骨架。 |
| H2 使用问句 / 对比句 question-headings | 4 | ChatGPT 按用户问题匹配段落,问句式标题命中率最高。 |
| 标题后紧跟 40–80 词直接结论 direct-answers | 4 | 能被整段摘走的答案块,是被引用的最小单元。 |
| 抽样页面的引用形态(产品 / 文章 / 分类) sampled-pages-shape | 5 | AI 引用发生在页面级,被引的从来不是首页。从 sitemap 抽产品页、文章页、分类页各一个,按同一套引用形态标准打分。 |
| Product / Offer 结构化数据完整 product-schema | 3 | ChatGPT 购物卡片直接读 Product 的 price、priceCurrency、availability、GTIN;缺了就进不了卡片。无产品页时不适用。 |
| 关于 / 联系 / 政策页可抓取 trust-pages | 2 | 引擎判断"这是一家真实商家"的最低门槛,也是 Agentic Commerce 要求的退换货 / 隐私政策 URL 的来源。 |
| 发布 / 更新日期可机读 dates | 3 | 带日期的页面更容易被选为"最新"来源;一年内更新加分。 |
| 作者 / 发布者可机读 author | 2 | 归属明确的内容更可信,E-E-A-T 的基础。 |
| JSON-LD 结构化数据 structured-data | 3 | Article / Product / Organization 等 schema 帮引擎理解页面是什么。 |
| 品牌实体(Organization + sameAs) org-entity | 2 | 让引擎把站点、社媒、Wikidata 等身份连成一个实体,"有其他站佐证"的起点。 |
| 可抽取的列表 / 表格 extractable-structures | 2 | 对比表、步骤列表最容易被整块摘录。 |
| 引用外部来源 outbound-citations | 2 | 有据可查的内容更像"可信资料",而不是营销页。 |
| <html lang> 声明 lang-declared | 1 | 让引擎把页面归入正确的语言市场。 |
| Open Graph 完整 open-graph | 1 | ChatGPT 引用卡片与分享预览的标题、描述、图片来源。 |
| <main> / <article> 语义容器 main-landmark | 1 | 帮抽取器区分正文与导航噪音。 |
| 图片 alt 文本 image-alt | 1 | 多模态检索与无障碍的共同基础。 |
新兴信号 · +5 分 · 有则加分,无不扣分
| 检查 | 权重 | 为什么重要 |
|---|---|---|
| /llms.txt llms-txt | 2 | 面向 LLM 的站点导览,告诉 agent 你是谁、何时该用你。 |
| /llms-full.txt llms-full-txt | 1 | 全文版导览,供 agent 一次读完。 |
| Accept: text/markdown 内容协商 markdown-negotiation | 1.5 | 同一 URL 给 agent 返回 Markdown,摘录零噪音。 |
| /.well-known/api-catalog api-catalog | 0.5 | RFC 9727 机器可读的 API 目录。 |
| AggregateRating / Review 结构化数据 review-schema | 1 | 评分与评论是购物类回答里最常被摘走的字段。 |
| FAQPage / HowTo 结构化数据 faq-schema | 1 | 问答对是最容易被整条摘走的形态。 |
| ETag / Last-Modified conditional-headers | 0.5 | 让爬虫用条件请求高效重抓。 |
实测抓取是怎么做的?
对同一 URL 分别用普通浏览器、OAI-SearchBot、ChatGPT-User、Bingbot 的 User-Agent 抓取,比较状态码、cf-mitigated 头、挑战页特征与正文长度。出口 IP 不是各爬虫的官方 IP 段,所以 IP 白名单式放行在此看不到;但 UA 级封禁(Cloudflare 的 AI 爬虫一键拦截、自定义 WAF 规则)会原形毕露。最终确认以服务器日志里真实爬虫回 200 为准。
"ChatGPT 视角"和"模拟提问"是什么?
报告里的 ChatGPT 视角把爬虫从原始 HTML 抽出的正文、每个 H2/H3 后的第一段直接摆出来,并标出哪些块符合"40–80 词直接结论"可整段引用、哪些需要改写、哪些标题后面根本没有段落。模拟提问则让模型扮演 ChatGPT 搜索:这页能回答用户的哪三个问题、会逐字摘走哪一段、摘不动的原因是什么。它是佐证,不计入分数——一次模拟代表不了所有提问。
这个分数不能说明什么?
- IndexNow 接入、Bing/GSC 的 DNS 验证、站外引用("其他站佐证")无法从站外验证,相关项标为仅展示或减半。
- 报告描述某一时刻的公开证据,不是认证,也不是安全或无障碍审计。
- 时效预期:已在 Bing 相关词前十的页面,发布后几天内就可能出现在引用里;Bing 零基础的站要 4–12 周。pin 省掉的是被发现的等待,省不掉的是建立权重的时间。
机器可读:/api/v1/methodology · Markdown · MCP 工具 is_cited_get_methodology