# 评分方法论 · 三层 pin 模型

ChatGPT 搜索的检索层 = Bing 索引 + OAI-SearchBot 补充抓取。被引用要过三道门：能不能主动推进索引（推送就绪）、爬虫能不能进门（抓取许可）、进了索引能不能被摘走（引用形态）。抓取许可是真实命门，权重最高。

## 权重

| 层 | 分值池 | 说明 |
|---|---|---|
| 抓取许可 | 45 | ChatGPT 搜索的检索层 = Bing 索引 + OAI-SearchBot 补充抓取。robots.txt 必须放行 OAI-SearchBot 与 ChatGPT-User，且 WAF（尤其 Cloudflare 的 Bot Fight / AI 爬虫拦截）不能把它们拦在门外。这一层是被引用的真实命门，权重最高。 |
| 推送就绪 | 25 | 主动把页面"pin"进 Bing 索引所需的基础设施：sitemap、Bing Webmaster Tools 验证、IndexNow、canonical、订阅源。省掉的是被发现的等待，省不掉的是建立权重的时间。 |
| 引用形态 | 30 | 进了索引不等于被引用。ChatGPT 挑的是能直接摘走的内容：服务端渲染的正文、问句式 H2、紧跟其后 40–80 词的直接结论、日期与作者、结构化数据、可抽取的列表与表格。 |
| 新兴信号 | +5 | llms.txt、Markdown 内容协商、API 目录、FAQ 结构化数据等面向 agent 的新约定。最多 +5 分，缺失不扣分。 |

每层内按检查权重加权平均后映射到分值池；不适用（N/A）的检查剔除不计罚；部分通过按比例得分。加分项最多 +5，缺失不扣分。总分上限 100。

## 硬门槛（封顶）

- 页面对普通访客不返回 200 → 总分封顶 29
- noindex、robots.txt 封 OAI-SearchBot、Content-Signal 禁止检索/AI 输入 → 总分封顶 39
- WAF 实测拦截 OAI-SearchBot → 封顶 49
- robots.txt 封 Bingbot → 封顶 59（Bingbot 的 WAF 实测只计分不封顶：大站普遍对 Bingbot 做 IP 反查）

## 抓取许可（45）

| 检查 | 权重 | 为什么重要 |
|---|---|---|
| robots.txt 放行 OAI-SearchBot | 10 | OAI-SearchBot 建 ChatGPT 搜索索引，封了它等于永久放弃被引用。 |
| robots.txt 放行 ChatGPT-User | 5 | 用户提问时的实时抓取，决定 ChatGPT 能否当场读到你的页面。 |
| robots.txt 放行 Bingbot | 5 | ChatGPT 搜索的检索层建在 Bing 索引上。 |
| robots.txt 放行 Googlebot | 2 | 喂 AI Overviews 与 Gemini。 |
| 放行其它 AI 答案引擎 | 3 | Perplexity、Claude、DuckDuckGo AI、Apple、Amazon 的检索爬虫，同一套逻辑。 |
| Content-Signal 未禁止 AI 检索 | 3 | Cloudflare 托管 robots.txt 会注入 Content-Signal，search=no 或 ai-input=no 会被合规爬虫尊重。 |
| 实测：OAI-SearchBot 身份可抓取 | 9 | robots.txt 写得再对，WAF 在前面拦一下就全白搭。以 OAI-SearchBot UA 实抓验证。 |
| 实测：ChatGPT-User 身份可抓取 | 5 | 实时抓取的身份，同样会被 Bot Fight Mode / AI 爬虫拦截规则误伤。 |
| 实测：Bingbot 身份可抓取 | 4 | 进不了 Bing 索引，ChatGPT 搜索就找不到你。 |
| 页面允许索引 | 5 | noindex（meta 或 X-Robots-Tag）会让页面从任何索引中消失。 |
| 允许摘录片段 | 3 | nosnippet / max-snippet:0 直接禁止引擎摘录你的文字。 |
| HTTP 基础健康 | 3 | HTTPS、200、短跳转链、合理响应时间是爬虫预算的前提。 |
| 不存在的路径返回真实 404 | 2 | 软 404 会让爬虫以为所有路径都存在，浪费抓取预算并污染索引。 |
| GPTBot（训练爬虫）策略 | 仅展示 | 放不放行不影响被引用，可自行决定。仅展示。 |
| CDN / WAF 识别 | 仅展示 | 走 Cloudflare 的站必须逐站核查 Bot Fight Mode 与 AI Crawl Control。仅展示。 |

## 推送就绪（25）

| 检查 | 权重 | 为什么重要 |
|---|---|---|
| sitemap.xml 存在且被 robots.txt 声明 | 6 | Bing Webmaster Tools 一键导入与 URL 提交都以 sitemap 为骨架。 |
| sitemap 带 lastmod 且近期更新 | 4 | lastmod 是 Bing 判断"要不要重抓"的主要信号。 |
| sitemap 里的 URL 真实存活 | 5 | sitemap 是你交给引擎的清单；里面的死链会让 OAI-SearchBot 把抓取预算花在 404 上，引用机会直接丢掉。抽检最多 8 条。 |
| Bing Webmaster Tools 验证痕迹 | 5 | 注册 Bing 站长平台才能手动请求收录——这就是那个"pin"按钮。 |
| Google Search Console 验证痕迹 | 1 | GSC 照旧走，喂 AI Overviews 与 Gemini。可能通过 DNS 验证，站外不可见。 |
| canonical 自指向 | 3 | 避免推送的 URL 与索引的 URL 不一致，权重被分散。 |
| 多语言 hreflang | 2 | 出海站的多语言版本要让 Bing 分清市场；单语站不适用。 |
| RSS / Atom 订阅源可发现 | 1 | Bing 支持订阅源提交，新文章发布可被快速发现。 |
| http 自动跳转 https | 2 | 推送的 URL 与最终 URL 必须一致，避免重复实体。 |
| title 与 meta description 完备 | 2 | Bing 索引条目的骨架，也是 ChatGPT 引用卡片的标题来源。 |
| IndexNow 即时推送 | 仅展示 | 发布瞬间 ping 一下，Bing 立即知道；key 文件名不可预测，站外无法验证，需自查。 |

## 引用形态（30）

| 检查 | 权重 | 为什么重要 |
|---|---|---|
| 服务端渲染的正文 | 6 | OAI-SearchBot 与 ChatGPT-User 不执行 JavaScript，看到的就是原始 HTML。 |
| 标题层级清晰 | 3 | 唯一 H1 + 多个 H2，层级不跳跃，是可摘录内容的骨架。 |
| H2 使用问句 / 对比句 | 4 | ChatGPT 按用户问题匹配段落，问句式标题命中率最高。 |
| 标题后紧跟 40–80 词直接结论 | 4 | 能被整段摘走的答案块，是被引用的最小单元。 |
| 抽样页面的引用形态（产品 / 文章 / 分类） | 5 | AI 引用发生在页面级，被引的从来不是首页。从 sitemap 抽产品页、文章页、分类页各一个，按同一套引用形态标准打分。 |
| Product / Offer 结构化数据完整 | 3 | ChatGPT 购物卡片直接读 Product 的 price、priceCurrency、availability、GTIN；缺了就进不了卡片。无产品页时不适用。 |
| 关于 / 联系 / 政策页可抓取 | 2 | 引擎判断"这是一家真实商家"的最低门槛，也是 Agentic Commerce 要求的退换货 / 隐私政策 URL 的来源。 |
| 发布 / 更新日期可机读 | 3 | 带日期的页面更容易被选为"最新"来源；一年内更新加分。 |
| 作者 / 发布者可机读 | 2 | 归属明确的内容更可信，E-E-A-T 的基础。 |
| JSON-LD 结构化数据 | 3 | Article / Product / Organization 等 schema 帮引擎理解页面是什么。 |
| 品牌实体（Organization + sameAs） | 2 | 让引擎把站点、社媒、Wikidata 等身份连成一个实体，"有其他站佐证"的起点。 |
| 可抽取的列表 / 表格 | 2 | 对比表、步骤列表最容易被整块摘录。 |
| 引用外部来源 | 2 | 有据可查的内容更像"可信资料"，而不是营销页。 |
| <html lang> 声明 | 1 | 让引擎把页面归入正确的语言市场。 |
| Open Graph 完整 | 1 | ChatGPT 引用卡片与分享预览的标题、描述、图片来源。 |
| <main> / <article> 语义容器 | 1 | 帮抽取器区分正文与导航噪音。 |
| 图片 alt 文本 | 1 | 多模态检索与无障碍的共同基础。 |

## 新兴信号（+5）

| 检查 | 权重 | 为什么重要 |
|---|---|---|
| /llms.txt | 2 | 面向 LLM 的站点导览，告诉 agent 你是谁、何时该用你。 |
| /llms-full.txt | 1 | 全文版导览，供 agent 一次读完。 |
| Accept: text/markdown 内容协商 | 1.5 | 同一 URL 给 agent 返回 Markdown，摘录零噪音。 |
| /.well-known/api-catalog | 0.5 | RFC 9727 机器可读的 API 目录。 |
| AggregateRating / Review 结构化数据 | 1 | 评分与评论是购物类回答里最常被摘走的字段。 |
| FAQPage / HowTo 结构化数据 | 1 | 问答对是最容易被整条摘走的形态。 |
| ETag / Last-Modified | 0.5 | 让爬虫用条件请求高效重抓。 |

## 局限

- 实测抓取使用对应爬虫的 User-Agent，但出口 IP 不是其官方 IP 段：IP 白名单式放行在此看不到，UA 级封禁会原形毕露。以服务器日志里真实爬虫回 200 为最终确认。
- IndexNow 接入、Bing/GSC 的 DNS 验证、站外引用（"其他站佐证"）无法从站外验证。
- 报告描述的是某一时刻的公开证据，不是认证，也不是安全或无障碍审计。

JSON：https://madeinred.com/api/v1/methodology